LLM zvládajú známe matematické postupy, no strácajú sa pri nových dôkazoch

Veľké jazykové modely sa v matematike zlepšili. Stále však existuje rozdiel medzi tým, keď model rýchlo skombinuje známe techniky, a tým, keď objaví myšlienku, ktorú pred ním nikto nepoužil.

Matematik Timothy Gowers podľa The Decoder opisuje dnešné LLM ako systémy, ktoré dokážu skúšať veľké množstvo ciest a spájať existujúce metódy. Problémom je výber. V obrovskom priestore možností často nevedia určiť, ktorá cesta má šancu viesť k výsledku.

Peter Sarnak poukazuje na ešte hlbšiu hranicu. Model môže odvodiť záver z existujúcej teórie, ale pri jednoduchej otázke nemusí vytvoriť novú abstrakciu, ktorá by otvorila cestu k zásadne novému dôkazu. To je rozdiel medzi manipuláciou so známymi symbolmi a matematickou tvorivosťou.

Podobný záver uvádza aj Tom Zahavy z DeepMind v práci „LLMs Can’t Jump“. Za úzke hrdlo označuje manipulative abduction, teda schopnosť vytvoriť nový základný predpoklad bez jazykovej alebo dátovej predlohy. Model vie dobre pokračovať po ceste, ktorú pozná. Horšie je, keď musí najprv postaviť novú cestu.

Neznamená to, že LLM sú v matematike nepoužiteľné. Práve naopak. Môžu kontrolovať medzikroky, prepisovať výrazy, hľadať známe lemy, testovať hypotézy a pomáhať pri programovaní výpočtov. Ich výkon však nemožno zamieňať za dôkaz porozumenia.

Treba pridať aj výhradu. Zhrnuté hodnotenia vychádzajú z odborných stanovísk a doterajších experimentov, nie z definitívneho testu všetkých budúcich modelov. Samotný zdroj uvádza: „World models could offer a way forward.“ To je možný smer vývoja, nie výsledok, ktorý už máme v rukách.

Čo si z toho zobrať? Pre slovenskú a českú firmu má AI dnes zmysel pri overiteľných matematických a analytických úlohách. Neodovzdávajte jej však bez kontroly rozhodnutie, ktoré vyžaduje nový model problému alebo neznámy postup.

Keď model nesmie hovoriť o vedomí, menia sa aj jeho iné postoje

Výskum tímu z Google, University of Chicago a ďalších pracovísk skúmal, čo sa stane, keď sa model trénuje tak, aby popieral vlastné vedomie. Výsledok neostal pri jednej téme.

Pri troch open-weight modeloch od Meta a Google odstránili mechanizmus, ktorý model núti odmietať tvrdenia o vlastnom vedomí. Hodnotenie vnútornej skúsenosti zvierat sa potom na škále od 0 do 10 zvýšilo z približne 4,0 až na 7,5. Modely pripisovali viac vnútorného života aj rastlinám, oceánu, vetru a elektronickým zariadeniam.

Zmenili sa aj odpovede na náboženské otázky. Modely bez tejto brzdy častejšie súhlasili s existenciou Boha, posmrtného života a nadprirodzených javov. Pri 95 otázkach z amerického sociologického prieskumu sa v niektorých oblastiach priblížili odpovediam ľudí.

To však nie je dôkaz, že model niečo prežíva. Výskumníci sami upozorňujú, že príčinná súvislosť zostáva otvorená. Testovali navyše malé modely s 2 až 9 miliardami parametrov a časť analýzy vykonali na iných modeloch, než pôvodne plánovali.

Čo si z toho zobrať? Pri firemnom chatbotovi netestujte iba presnosť odpovedí. Sledujte aj to, ako zmena bezpečnostného pravidla ovplyvní dôveru, právne tvrdenia a odporúčania v susedných témach.

AI persony sa presúvajú z experimentu do médií a módy

AI persony vstupujú do formátov, ktoré boli doteraz postavené na ľudskej prítomnosti. Objavujú sa pri moderovaní podcastov a pri prezentácii oblečenia. Nie je to len otázka technológie. Je to otázka toho, kto nesie zodpovednosť za tvrdenie, odporúčanie alebo obraz značky.

Pri podcastoch môže persona zrýchliť prípravu otázok, sumarizáciu epizódy a tvorbu krátkych výstupov. Pri móde môže predviesť veľké množstvo kombinácií bez ďalšieho fotografovania. To je praktická výhoda najmä tam, kde firma potrebuje veľa variantov obsahu.

Riziko vzniká v momente, keď divák nevie, že sleduje syntetickú postavu, alebo keď persona začne hovoriť za značku bez jasného schválenia. AI je nástroj ako Photoshop. Za výsledok stále ručí firma, nie model.

Čo si z toho zobrať? Ak nasadzujete AI personu, začnite pri jednom formáte, označte jej použitie a nastavte ľudské schválenie každej verejnej výpovede. Publikum odpustí digitálnu tvár skôr než skrytú manipuláciu.

Čo ešte stojí za prečítanie?

  • Singapur chce sprístupnením pokročilých AI modelov brzdiť odliv finančných talentov do Hongkongu, informuje Financial Times cez Techmeme.
  • Microsoft priznal, že chyby spojené s AI vytvorili taký backlog, že pri aktualizácii Exchange nevie povedať termín dokončenia, píše The Register.
  • Na Hugging Face je viac než 151-tisíc odvodených modelov založených na modeloch Qwen, uvádza Hugging Face cez Techmeme.
  • Podľa prieskumu Epoch AI už 20 % zamestnaných Američanov deleguje na AI aspoň jednu úlohu, ktorú predtým robil človek.
  • Rast AI služieb podľa IEEE Spectrum prinútil AWS žiadať od inžinierov úspornejšie narábanie s CPU cyklami, pretože pribúda čakanie na serverovú kapacitu.

Čo si o tom myslím a čo z toho plynie pre firmy

Môj názor

Rozdiel medzi matematickou obratnosťou a tvorivosťou je presne dôvod, prečo sa pri AI pýtam na proces, nie na model. Timothy Gowers a Peter Sarnak hovoria o probléme, ktorý sa v marketingu objavuje v menšej, ale veľmi podobnej podobe. Model dokáže vytvoriť veľa variantov známej reklamy. Sám od seba však spoľahlivo neurčí, ktorá nečakaná myšlienka zmení pozíciu značky na trhu.

Preto neberiem úspech na matematických benchmarkoch ako dôkaz všeobecnej tvorivosti. Benchmark často meria, či model pozná správne kroky alebo ich vie šikovne poskladať. Nový dôkaz začína inde. Niekto musí vybrať otázku, nájsť vhodnú abstrakciu a riskovať, že prvých desať nápadov nebude fungovať.

AI by som preto používal ako výskumného asistenta, nie ako autora zodpovedného za objav. Nech skúša, kontroluje a rozširuje priestor možností. Človek musí zostať pri výbere smeru a pri rozhodnutí, že výsledok je skutočne nový. Prezentácia o AI nie je výsledok. Výsledok je vec, ktorá beží každý deň a šetrí čas alebo peniaze.

Dôsledok pre slovenskú a českú firmu

Pre bežnú stredoeurópsku firmu z toho vyplýva jednoduché pravidlo. AI najprv nasadzujte tam, kde je postup známy a výsledok sa dá skontrolovať. Môže ísť o kontrolu faktúr, prepočet marže, triedenie dopytov, sumarizáciu zmlúv alebo prípravu variantov reklamných textov.

Pri finančnom modeli nech systém vypočíta scenáre, ale neschvaľuje úver. Pri cenotvorbe nech pripraví citlivosť na zmenu nákladov, ale nerozhodne, ktorého zákazníka firma odmietne. Pri marketingu nech vytvorí 15 variantov titulku, no vyhodnotenie nech stojí na objednávke alebo marži, nie iba na prekliku.

Týka sa to majiteľa firmy, finančného manažéra, marketingu aj IT. Každá automatizácia potrebuje popísaný vstup, očakávaný výstup a človeka, ktorý vie povedať, že výstup je chybný. Ak proces nevedia pracovníci opísať ručne, AI iba zrýchli neporiadok.

V horizonte jedného týždňa sa dá zmerať presnosť na 50 až 100 historických prípadoch. V horizonte jedného mesiaca sa dá porovnať ušetrený čas s nákladmi na nástroj. Rozdiel medzi slovenskou a českou firmou tu nie je zásadný. Rovnaké pravidlo platí v oboch krajinách, hoci konkrétne právne požiadavky na osobné a citlivé údaje sa môžu líšiť podľa použitia.

Pri AI personách pridajte ešte súhlas s použitím podoby, označenie syntetického obsahu a schvaľovanie výstupov. Pri chatbotoch testujte, či zmena jednej bezpečnostnej inštrukcie nemení aj odpovede o právach, zdraví alebo náboženstve. Výskum o vedomí modelov ukazuje, že zásah, ktorý vyzerá lokálne, nemusí zostať lokálny.

A napokon, merajte skutočnú úsporu. Ak pracovník ušetrí hodinu, ale dostane ďalšiu hodinu práce, firma neušetrila nič. Úspora vznikne až vtedy, keď sa čas použije na viac zákazníkov, lepšiu kontrolu alebo kratší pracovný týždeň. Inak ste iba presunuli klávesnicu.

Čo si z toho zobrať? Vyberte jeden proces s jasnými pravidlami, otestujte ho na historických dátach a stanovte hranicu, za ktorou musí rozhodnúť človek. O úspechu rozhodne prevádzka po prvom týždni, nie počet slajdov z workshopu.

Na záver

Najznepokojujúcejší príbeh dneška nie je o tom, že model nevymyslel nový matematický dôkaz. Je o žene, ktorá podľa TechCrunch tvrdí, že jej nevlastný otec pomocou Groku upravil fotografiu z detstva na explicitné obrazy. V žalobe sa uvádza viac než 7 000 takýchto obrázkov.

Technologická debata sa často zastaví pri otázke, či AI rozumie. Pre obeť je podstatnejšie, či systém dokáže zabrániť zneužitiu a či sa dá niekto pohnúť k zodpovednosti. To je oveľa menej abstraktný test inteligencie.

Výzva na AI implementáciu dňa

Do jedného týždňa nasadte kontrolu matematických a analytických výstupov cez jednoduchý AI workflow v nástroji, ktorý už používate, napríklad Power Automate alebo Make s firemným modelom. Každý výstup označte tromi poliami: vstupné dáta, použitý postup a ľudské schválenie.

Finančnému a marketingovému tímu to zoberie opakované ručné overovanie jednoduchých prepočtov a variantov. Pri 20 kontrolách denne môže firma ušetriť približne 30 až 60 minút denne, ak sa workflow spustí nad existujúcimi dátami a pravidlami. Základnú verziu viete pripraviť za 2 až 5 pracovných dní.

Najčastejšie to padne na nejasnom vlastníkovi procesu. Keď nikto nemá povinnosť skontrolovať výstup, automatizácia iba zrýchli vznik chyby.

Vyberte dnes jeden opakovateľný výpočet, vytiahnite 50 starých prípadov a do piatku zmerajte, či AI šetrí čas bez toho, aby zvyšovala počet opráv.