Najlepšie multimodálne modely stále zlyhávajú pri samotnom videní

Moonshot AI, tím stojaci za asistentom Kimi, predstavil benchmark PerceptionBench. Test má oddeliť vizuálne vnímanie od uvažovania, znalostí a schopnosti pekne vysvetliť odpoveď. Každá úloha má byť riešiteľná iba pohľadom na obrázok.

To je podstatná zmena oproti bežným multimodálnym testom. Tie často spoja čítanie obrazu, prácu s kontextom a logickú úlohu do jedného skóre. Keď model odpovie nesprávne, nevieme, či obraz zle prečítal, alebo zle uvažoval.

PerceptionBench rozdelil vizuálne schopnosti do 10 oblastí. Patrí medzi ne počítanie, priestorové vzťahy, lokalizácia, hĺbka a 3D, atribúty objektov, porovnávanie, OCR, rozpoznávanie detailov, kontext a halucinácie. Kategórie nevznikli iba pri stole. Výskumníci ich zostavili z reálnych chýb modelov.

Z viac ako 17 000 overených otázok zverejnili 3 000 úloh. Približne 60 percent vychádzalo z pozorovaných chýb modelov a zvyšok vznikol úpravou obrázkov. Príklady vyzerajú jednoducho. Model má určiť polohu symbolu na ciferníku, spočítať kvety v červenom rámčeku alebo povedať, či sa na obrázku vôbec nachádza určitý predmet.

Výsledok je nepríjemne nízky. Zo 16 testovaných frontier modelov dosiahol najvyššie skóre GPT-5.6 Sol, konkrétne 59,7 percenta. Kimi K3 mal 58,5 percenta, Claude Fable 5 57,2 percenta, Gemini 3.1 Pro 56,2 percenta a GPT-5.5 55,8 percenta. Žiadny model neprekročil hranicu 60 percent.

Rozdiel medzi prvými piatimi modelmi bol pritom necelé 4 percentuálne body. To nie je súťaž, v ktorej víťaz ušiel pelotónu. Je to skôr päť študentov, ktorí si pri rovnakom teste vymenili miesta podľa toho, či sa pýtate na počítanie alebo na malé detaily.

Najslabšia oblasť bola halucinácia, teda schopnosť nevymyslieť objekt, ktorý na obrázku nie je. GPT-5.6 Sol v nej získal iba 26,9 percenta. Gemini 3.5 Flash, ktorý mal slabšie celkové skóre, tu dosiahol 50,6 percenta.

Výskum zároveň spochybňuje bežné vysvetlenie, že multimodálny model urobil „chybu v uvažovaní“. Pri viacstupňovej úlohe môže byť problém už v prvom kroku. Model nesprávne prečíta obraz a potom iba konzistentne rozvíja nesprávny vstup.

Výsledky zapadajú do starších zistení. V teste WorldVQA najlepší model dosiahol 47,4 percenta. V benchmarku BabyVision získal Gemini 3 Pro 49,7 percenta, zatiaľ čo ľudia 94,1 percenta. Tieto porovnania však treba čítať opatrne. Každý benchmark testuje inú sadu úloh a nie je úplnou simuláciou práce človeka. Aj samotní autori upozorňujú, že existujúce benchmarky zachytávajú iba úzke výseky chýb vnímania.

Čo si z toho zobrať? Ak chcete vo firme použiť AI na čítanie faktúr, fotografií, skladových štítkov alebo kontrolu výrobkov, nezačínajte tvrdením, že model „vidí“. Pripravte vlastnú testovaciu vzorku, merajte presnosť podľa typu chyby a pri kritických výstupoch nechajte rozhodnutie na človeku.

AI knihy zapĺňajú katalóg rýchlejšie než trh rastie

Analýza 14 419 náhodne vybraných samo-vydaných e-kníh na Amazone sledovala tituly vydané od januára 2023 do marca 2026. Výskumníci porovnávali plné texty s detektorom Pangram v3.3 a rozdelili knihy podľa podielu textu označeného ako pravdepodobne vytvorený AI.

Knihy s výrazným podielom AI tvorili 20 percent sledovaného katalógu. Na predaji však mali podiel 12,1 percenta a na tržbách 11,3 percenta. Tituly bez zachyteného AI textu tvorili 62,9 percenta katalógu a priniesli 72,5 percenta tržieb.

Na prvý pohľad to vyzerá ako dôkaz, že AI knihy sú iba lacná výplň. Lenže pod povrchom sa zmenšil celý priestor pre každého autora. Katalóg medzi prvým štvrťrokom 2023 a prvým štvrťrokom 2026 narástol 38,3-násobne, počet titulov s predajom za štvrťrok 19,2-násobne a tržby iba 8,9-násobne.

Tržba na knihu klesla v 6 z 8 žánrov. Pri knihách bez zachyteného AI textu klesla v 7 z 8 žánrov. Autori štúdie výslovne upozorňujú, že ide o pozorovacie a súvislostné zistenie. Nepreukazuje, že pokles spôsobila samotná AI.

Čo si z toho zobrať? Pri firemnom obsahu nestačí vyrábať viac textu lacnejšie. Ak rastie počet priemerných výstupov rýchlejšie než dopyt, cena pozornosti klesá aj pre kvalitné značky. AI používajte na varianty a rešerš, nie ako náhradu za vlastný názor a redakčnú kontrolu.

Alibaba hlási tri miliardy stiahnutí open-weight modelov

Alibaba tvrdí, že jej open-weight modely za posledných 6 mesiacov prekročili 3 miliardy stiahnutí. Open-weight znamená, že váhy modelu sú dostupné na použitie alebo úpravu podľa konkrétnych licenčných podmienok, nie že celý systém je automaticky otvorený vo všetkých ohľadoch.

Samotný počet stiahnutí však nehovorí, koľko nasadení beží v produkcii. Jedno stiahnutie môže znamenať test, archiváciu, ďalšie zrkadlo alebo reálne používaný model. Pri tomto tvrdení navyše v dodanom materiáli chýba nezávislý zdroj a detailná metodika. Preto ho treba čítať ako firemné oznámenie, nie ako overený počet aktívnych používateľov.

Pre firmy v strednej Európe je zaujímavejšia dostupnosť alternatív než samotné marketingové číslo. Open-weight model môže dávať zmysel pri citlivých dokumentoch, veľkom objeme požiadaviek alebo potrebe prevádzky vo vlastnom prostredí. Prináša však aj náklady na infraštruktúru, aktualizácie, bezpečnostné testy a prevádzkový dohľad.

Čo si z toho zobrať? Pri výbere modelu porovnajte cenu rozhrania s úplnými nákladmi vlastnej prevádzky. Stiahnutie modelu nie je implementácia. Pred rozhodnutím si zmerajte objem dát, požadovanú latenciu, náklady na server a spôsob odchodu k inému dodávateľovi.

Čo ešte stojí za prečítanie?

  • Robotická firma Unitree v roku 2025 odoslala viac ako 5 500 humanoidných robotov a pripravuje vstup na čínsku burzu, podľa správy Wired cez Techmeme.
  • Podniky v roku 2025 minuli na kvantové počítanie 300 miliónov dolárov, prvýkrát viac než výskumné laboratóriá a vlády dohromady, uvádza Wall Street Journal a BCG cez Techmeme.
  • World Labs dokáže z jednej reálnej robotickej úlohy vytvoriť tisíce simulovaných variácií na tréning riadenia, píše The Decoder.
  • Nový arXiv príspevok navrhuje diagnostiku výskumnej integrity jazykových modelov používaných ako spolupracovníci vedcov, podrobnosti sú v práci na arXive.
  • Pri veľkom počte súčasných obmedzení môžu jazykové modely zažiť prudký prepad výkonu, uvádza ďalší arXiv príspevok.

Čo si o tom myslím a čo z toho plynie pre firmy

Môj názor

Výsledok PerceptionBench beriem ako užitočnú brzdu voči predstave, že vyššie skóre v uvažovaní automaticky znamená spoľahlivejší obraz sveta. Neznamená. Model môže veľmi presvedčivo vysvetliť, prečo je na obrázku päť predmetov, hoci tam sú štyri. V takom prípade nepomôže dlhšia odpoveď ani lepšie formulovaný prompt. Chyba vznikla ešte pred uvažovaním.

Považujem za správne, že benchmark rozkladá úlohu na menšie schopnosti. Celkové skóre 59,7 percenta je síce jednoduché na titulok, ale rozdiel medzi 26,9 percenta pri halucináciách a 50,6 percenta pri inom modeli je pre nasadenie oveľa dôležitejší. Firma nepotrebuje vedieť, ktorý model vyhral tabuľku. Potrebuje vedieť, v ktorom type dokumentu sa pomýli.

Prezentácia AI nie je výsledok. Výsledkom je proces, ktorý beží každý deň a šetrí čas alebo peniaze. PerceptionBench preto podľa mňa nie je dôvod AI odložiť. Je dôvod prestať jej dávať úlohy bez merania. Ak systém číta etikety, kontroluje poškodenie alebo extrahuje údaje z fotografií, musí mať vzorku reálnych prípadov, prah istoty a jasný postup pri neistote.

Dôsledok pre slovenskú a českú firmu

Pre bežnú slovenskú a českú firmu to mení najmä spôsob nákupu. Obchodník vám ukáže ukážku s čistým obrázkom a správnym výsledkom. Vy si potrebujete vypýtať test na vlastných dátach, vrátane rozmazaných fotografií, rôznych formátov, chýbajúcich polí a dokumentov od viacerých dodávateľov.

Vo financiách sa to týka účtovníkov a back-office tímov. AI môže predvyplniť faktúru, ale nemala by bez kontroly rozhodnúť o sume, sadzbe DPH alebo bankovom účte. Vo výrobe sa to týka kvality. Model môže označiť výrobok ako bezchybný aj vtedy, keď nevidí malú prasklinu. V logistike môže zle prečítať štítok a vytvoriť problém, ktorý sa prejaví až u zákazníka.

Praktický postup sa dá nastaviť za niekoľko dní. Zhromaždite 200 až 500 historických prípadov, nechajte ich označiť človekom a rozdeľte chyby podľa typu. Potom porovnajte dva alebo tri modely na rovnakej vzorke. Nemerajte iba priemernú presnosť. Sledujte aj počet kritických chýb, počet prípadov odoslaných na ručnú kontrolu a čas na jednu položku.

Pri slovenskom aj českom trhu platí rovnaká technická pointa. Rozdiel môže byť v dokumentoch, jazyku, účtovných pravidlách a dodávateľských formulároch. Preto nestačí test z amerického benchmarku. PerceptionBench vám ukáže všeobecnú slabinu, ale nepovie, ako dobre model prečíta váš český dodací list alebo slovenskú výrobnú etiketu.

Rovnakú disciplínu treba použiť pri knihách a firemnom obsahu. Alibaba zase ukazuje, že dostupnosť modelu môže rásť rýchlejšie než schopnosť firmy ho bezpečne prevádzkovať. Počet stiahnutí nie je počet zákazníkov a počet vygenerovaných textov nie je počet užitočných výstupov. Úspora času existuje až vtedy, keď ušetrený čas použijete na ďalšiu prácu, nie keď iba zväčšíte kopu konceptov.

Najväčšie riziko dnes nevidím v tom, že firmy AI nepoužijú. Vidím ho v tom, že ju nasadia do procesu, ktorý nemá definovaný správny výsledok. Automatizovať neporiadok znamená iba vyrábať neporiadok rýchlejšie. Pri obraze je tento problém horší, pretože chybný výstup často vyzerá sebaisto a systém môže padať potichu.

Čo si z toho zobrať? Každý AI projekt, ktorý pracuje s obrazom, musí mať pred produkciou vlastný test, definované kritické chyby a človeka zodpovedného za kontrolu. Model vyberajte až po meraní procesu. Najlepší model na internom rebríčku nemusí byť najlepší model pre vašu firmu.

Na záver

Ľudia v Číne sú podľa prehľadu cez Techmeme voči AI optimistickejší než Američania. Aj tu platí, že číslo je iba začiatok príbehu. Optimizmus môže znamenať väčšiu dôveru v technológiu, ale aj väčšie očakávania od štátu, škôl a firiem.

Technológie sa napokon neusádzajú v spoločnosti preto, že vyhrajú benchmark. Usadia sa vtedy, keď ľuďom odstránia konkrétnu otravnú úlohu a zároveň im nevezmú možnosť skontrolovať výsledok. Aj umelá inteligencia potrebuje niekoho, kto sa pozrie na obraz a povie: toto nesedí.

Výzva na AI implementáciu dňa

Do jedného týždňa nasaďte malý vizuálny overovač pre jeden konkrétny typ dokumentu, napríklad dodávateľskú faktúru. Vyberte 200 historických kusov, označte správne hodnoty a porovnajte výstup dvoch dostupných multimodálnych modelov. Automatizácia môže účtovníkovi alebo administratíve zobrať prvé prepisovanie údajov, nie konečné schválenie.

Pri 200 dokumentoch mesačne a 3 minútach ručného prepisu je realistická úspora približne 10 hodín mesačne. Prvú verziu viete spustiť za 3 až 5 pracovných dní. Najčastejšie padne na nejasnom pravidle, čo má systém urobiť pri nízkej istote alebo nečitateľnom poli.

Vyberte jednu sadu dokumentov, zmerajte ju a nastavte kontrolu ešte tento týždeň.