LLM zvládají známé matematické postupy, při nových důkazech se však ztrácejí
Velké jazykové modely se v matematice zlepšily. Stále však existuje rozdíl mezi tím, když model rychle zkombinuje známé techniky, a tím, když objeví myšlenku, kterou před ním nikdo nepoužil.
Matematik Timothy Gowers podle The Decoder popisuje dnešní LLM jako systémy, které dokážou zkoušet velké množství cest a spojovat existující metody. Problémem je výběr. V obrovském prostoru možností často nedokážou určit, která cesta má šanci vést k výsledku.
Peter Sarnak poukazuje na ještě hlubší hranici. Model může odvodit závěr z existující teorie, ale u jednoduché otázky nemusí vytvořit novou abstrakci, která by otevřela cestu k zásadně novému důkazu. To je rozdíl mezi manipulací se známými symboly a matematickou tvořivostí.
Podobný závěr uvádí i Tom Zahavy z DeepMind v práci „LLMs Can’t Jump“. Za úzké hrdlo označuje manipulative abduction, tedy schopnost vytvořit nový základní předpoklad bez jazykové nebo datové předlohy. Model dokáže dobře pokračovat po cestě, kterou zná. Horší je, když musí nejprve postavit novou cestu.
Neznamená to, že LLM jsou v matematice nepoužitelné. Právě naopak. Mohou kontrolovat mezikroky, přepisovat výrazy, hledat známá lemmata, testovat hypotézy a pomáhat při programování výpočtů. Jejich výkon však nelze zaměňovat za důkaz porozumění.
Je třeba přidat i výhradu. Shrnutá hodnocení vycházejí z odborných stanovisek a dosavadních experimentů, nikoli z definitivního testu všech budoucích modelů. Samotný zdroj uvádí: „World models could offer a way forward.“ To je možný směr vývoje, nikoli výsledek, který už máme v rukou.
Co si z toho odnést? Pro slovenskou a českou firmu má dnes AI smysl u ověřitelných matematických a analytických úloh. Bez kontroly jí však nepředávejte rozhodnutí, které vyžaduje nový model problému nebo neznámý postup.
Když model nesmí mluvit o vědomí, mění se i jeho další postoje
Výzkum týmu z Google, University of Chicago a dalších pracovišť zkoumal, co se stane, když se model trénuje tak, aby popíral vlastní vědomí. Výsledek nezůstal u jediného tématu.
U tří open-weight modelů od Meta a Google odstranili mechanismus, který model nutí odmítat tvrzení o vlastním vědomí. Hodnocení vnitřní zkušenosti zvířat se pak na škále od 0 do 10 zvýšilo z přibližně 4,0 až na 7,5. Modely připisovaly více vnitřního života také rostlinám, oceánu, větru a elektronickým zařízením.
Změnily se i odpovědi na náboženské otázky. Modely bez této brzdy častěji souhlasily s existencí Boha, posmrtného života a nadpřirozených jevů. U 95 otázek z amerického sociologického průzkumu se v některých oblastech přiblížily odpovědím lidí.
To však není důkaz, že model něco prožívá. Výzkumníci sami upozorňují, že příčinná souvislost zůstává otevřená. Testovali navíc malé modely s 2 až 9 miliardami parametrů a část analýzy provedli na jiných modelech, než původně plánovali.
Co si z toho odnést? U firemního chatbota netestujte pouze přesnost odpovědí. Sledujte také to, jak změna bezpečnostního pravidla ovlivní důvěru, právní tvrzení a doporučení v sousedních tématech.
AI persony se přesouvají z experimentu do médií a módy
AI persony vstupují do formátů, které dosud stály na lidské přítomnosti. Objevují se při moderování podcastů a prezentaci oblečení. Není to jen otázka technologie. Je to otázka toho, kdo nese odpovědnost za tvrzení, doporučení nebo obraz značky.
U podcastů může persona urychlit přípravu otázek, sumarizaci epizody a tvorbu krátkých výstupů. V módě může předvést velké množství kombinací bez dalšího fotografování. To je praktická výhoda zejména tam, kde firma potřebuje mnoho variant obsahu.
Riziko vzniká ve chvíli, kdy divák neví, že sleduje syntetickou postavu, nebo když persona začne mluvit za značku bez jasného schválení. AI je nástroj jako Photoshop. Za výsledek stále ručí firma, nikoli model.
Co si z toho odnést? Pokud nasazujete AI personu, začněte u jednoho formátu, označte její použití a nastavte lidské schválení každého veřejného sdělení. Publikum odpustí digitální tvář spíše než skrytou manipulaci.
Co ještě stojí za přečtení?
- Singapur chce zpřístupněním pokročilých AI modelů brzdit odliv finančních talentů do Hongkongu, informuje Financial Times přes Techmeme.
- Microsoft přiznal, že chyby spojené s AI vytvořily takový backlog, že při aktualizaci Exchange nedokáže říct termín dokončení, píše The Register.
- Na Hugging Face je více než 151-tisíc odvozených modelů založených na modelech Qwen, uvádí Hugging Face přes Techmeme.
- Podle průzkumu Epoch AI už 20 % zaměstnaných Američanů deleguje na AI alespoň jeden úkol, který dříve dělal člověk.
- Růst AI služeb podle IEEE Spectrum přiměl AWS požadovat po inženýrech úspornější nakládání s CPU cykly, protože přibývá čekání na serverovou kapacitu.
Co si o tom myslím a co z toho plyne pro firmy
Můj názor
Rozdíl mezi matematickou obratností a tvořivostí je přesně důvod, proč se u AI ptám na proces, nikoli na model. Timothy Gowers a Peter Sarnak mluví o problému, který se v marketingu objevuje v menší, ale velmi podobné podobě. Model dokáže vytvořit mnoho variant známé reklamy. Sám od sebe však spolehlivě neurčí, která nečekaná myšlenka změní pozici značky na trhu.
Proto nepovažuji úspěch v matematických benchmarcích za důkaz obecné tvořivosti. Benchmark často měří, zda model zná správné kroky nebo je umí obratně poskládat. Nový důkaz začíná jinde. Někdo musí vybrat otázku, najít vhodnou abstrakci a riskovat, že prvních deset nápadů nebude fungovat.
AI bych proto používal jako výzkumného asistenta, nikoli jako autora odpovědného za objev. Ať zkouší, kontroluje a rozšiřuje prostor možností. Člověk musí zůstat u výběru směru a u rozhodnutí, že výsledek je skutečně nový. Prezentace o AI není výsledek. Výsledkem je věc, která běží každý den a šetří čas nebo peníze.
Důsledek pro slovenskou a českou firmu
Pro běžnou středoevropskou firmu z toho vyplývá jednoduché pravidlo. AI nejprve nasazujte tam, kde je postup známý a výsledek se dá zkontrolovat. Může jít o kontrolu faktur, přepočet marže, třídění poptávek, sumarizaci smluv nebo přípravu variant reklamních textů.
U finančního modelu nechte systém vypočítat scénáře, ale neschvalujte jeho prostřednictvím úvěr. U cenotvorby ať připraví citlivost na změnu nákladů, ale nerozhoduje, kterého zákazníka firma odmítne. V marketingu ať vytvoří 15 variant titulku, ale vyhodnocení ať stojí na objednávce nebo marži, nikoli pouze na prokliku.
Týká se to majitele firmy, finančního manažera, marketingu i IT. Každá automatizace potřebuje popsaný vstup, očekávaný výstup a člověka, který dokáže říct, že výstup je chybný. Pokud pracovníci proces nedokážou ručně popsat, AI pouze urychlí nepořádek.
V horizontu jednoho týdne lze změřit přesnost na 50 až 100 historických případech. V horizontu jednoho měsíce lze porovnat ušetřený čas s náklady na nástroj. Rozdíl mezi slovenskou a českou firmou zde není zásadní. Stejné pravidlo platí v obou zemích, i když konkrétní právní požadavky na osobní a citlivé údaje se mohou lišit podle použití.
U AI person přidejte ještě souhlas s použitím podoby, označení syntetického obsahu a schvalování výstupů. U chatbotů testujte, zda změna jediného bezpečnostního pokynu nemění také odpovědi o právech, zdraví nebo náboženství. Výzkum vědomí modelů ukazuje, že zásah, který vypadá lokálně, nemusí lokální zůstat.
A nakonec měřte skutečnou úsporu. Pokud pracovník ušetří hodinu, ale dostane další hodinu práce, firma neušetřila nic. Úspora vznikne až tehdy, když se čas využije na více zákazníků, lepší kontrolu nebo kratší pracovní týden. Jinak jste pouze přesunuli klávesnici.
Co si z toho odnést? Vyberte jeden proces s jasnými pravidly, otestujte ho na historických datech a stanovte hranici, za níž musí rozhodnout člověk. O úspěchu rozhodne provoz po prvním týdnu, nikoli počet slajdů z workshopu.
Na závěr
Nejznepokojivější dnešní příběh není o tom, že model nevymyslel nový matematický důkaz. Je o ženě, která podle TechCrunch tvrdí, že její nevlastní otec pomocí Groku upravil fotografii z dětství na explicitní obrazy. V žalobě se uvádí více než 7 000 takových obrázků.
Technologická debata se často zastaví u otázky, zda AI rozumí. Pro oběť je podstatnější, zda systém dokáže zabránit zneužití a zda lze někoho přimět k odpovědnosti. To je mnohem méně abstraktní test inteligence.
Výzva k AI implementaci dne
Do jednoho týdne nasaďte kontrolu matematických a analytických výstupů prostřednictvím jednoduchého AI workflow v nástroji, který už používáte, například Power Automate nebo Make s firemním modelem. Každý výstup označte třemi poli: vstupní data, použitý postup a lidské schválení.
Finančnímu a marketingovému týmu to ušetří opakované ruční ověřování jednoduchých přepočtů a variant. Při 20 kontrolách denně může firma ušetřit přibližně 30 až 60 minut denně, pokud se workflow spustí nad existujícími daty a pravidly. Základní verzi dokážete připravit za 2 až 5 pracovních dnů.
Nejčastěji to ztroskotá na nejasném vlastníkovi procesu. Když nikdo nemá povinnost výstup zkontrolovat, automatizace pouze urychlí vznik chyby.
Vyberte dnes jeden opakovatelný výpočet, vytáhněte 50 starých případů a do pátku změřte, zda AI šetří čas, aniž by zvyšovala počet oprav.
