Meta presúva časť AI výkonu z cloudu na lokálny hardvér

Meta oznámila návrat k otvoreným váham veľkých jazykových modelov a predstavila Muse Glimmer. Model má 30 miliárd parametrov a predvolené kontextové okno s dĺžkou 128 000 tokenov. Je určený na lokálne spustenie namiesto používania výhradne cez cloud alebo API.

Váhy sú dostupné pod licenciou Apache 2.0. Firma tak môže model prevádzkovať vo vlastnej infraštruktúre, upravovať ho a kontrolovať, kam putujú vstupné dáta. To však neznamená, že nasadenie je zadarmo. Namiesto poplatku za API pribudne cena GPU, elektriny, údržby, aktualizácií a dohľadu.

Meta uvádza, že Muse Glimmer vznikol destiláciou modelu Muse Spark. Destilácia (učenie menšieho modelu z výstupov väčšieho modelu) sa stala súčasťou sporu medzi vývojármi uzavretých a otvorených modelov. Meta ju považuje za legitímnu súčasť vývoja, pričom odlišuje učenie z pozorovateľných výstupov od nezákonného získavania hodnoty z uzavretých systémov.

Ide aj o strategický obrat. Muse Spark prišiel v apríli ako uzavretý model. V júli Meta uviedla jeho prvú platenú službu a 5. augusta vydala Muse Spark 1.2 spolu s nástrojom Muse Code pre programovanie v termináli. Podľa Ars Technica Muse Code zaostáva za najlepšími modelmi od Anthropic a OpenAI v schopnostiach, no konkuruje cenou.

Na prvý pohľad to vyzerá ako návrat k pôvodnej filozofii Mety. Lenže pod povrchom ide aj o reakciu na čínske modely, ktoré ponúkajú otvorené váhy, nízku cenu a možnosť úprav. Meta sa tak nestavia priamo proti najdrahším frontier modelom (najvýkonnejším modelom na trhu), ale hľadá pozíciu otvorenejšej a dostupnejšej alternatívy.

Pri lokálnom nasadení treba zostať presný. Zdroj hovorí, že Muse Glimmer je navrhnutý na beh na spotrebiteľských GPU, nie že bez úprav funguje na každej grafickej karte. Výsledok ovplyvní množstvo pamäte, kvantizácia, ovládače a konkrétna úloha. To je rozdiel medzi technologickou možnosťou a hotovým firemným riešením.

Čo si z toho zobrať? Pre slovenskú a českú firmu nie je prvým krokom sťahovanie modelu. Najprv zmerajte mesačný objem API volaní, citlivosť dát a cenu súčasnej prevádzky. Až potom porovnajte cloud s lokálnym modelom na jednej konkrétnej úlohe.

OCR je lacnejšie a presnejšie, no stále nie bez kontroly

Projekt FineBooks od Hugging Face a EleutherAI otestoval 14 otvorených OCR modelov na 2 165 stranách historických kníh. OCR, teda optické rozpoznávanie znakov, premieňa skeny na text. Staršie OCR však často obsahuje chyby, ktoré znižujú kvalitu dát pre trénovanie jazykových modelov.

Najlepší model dots.mocr dosiahol 97,6-percentnú presnosť znakov pri nákladoch 1,94 dolára na 1 000 strán. OvisOCR2 s 0,9 miliardy parametrov dosiahol 96,9 percenta a náklady 0,46 dolára na 1 000 strán. Väčší model teda automaticky neznamenal lepší výsledok.

Výsledky sú podľa The Decoder dostatočné pre prípravu tréningových dát, nie však pre vedecké alebo historické prepisy. Test pokrýval iba staršie latinské písmo Antiqua, štyri jazyky a jednostĺpcové stránky. Nezahŕňal Fraktúru, nelatinské písma ani rukopis.

To je praktická výhrada. Model môže text prepísať lacno a rýchlo, ale zároveň potichu modernizovať staré znaky alebo ligatúry. Pri archívnom dokumente môže byť práve takáto zmena významná.

Čo si z toho zobrať? Pri digitalizácii dokumentov testujte OCR na vlastnej vzorke a výstupy rozdeľte podľa účelu. Pre interné vyhľadávanie môže byť 97,6 percenta postačujúcich. Pre zmluvy, faktúry a vedecké dokumenty potrebujete kontrolu človekom a jasný prah prijateľnej chyby.

Čo ešte stojí za prečítanie?

  • OpenAI uvádza, že model GPT-5.6-Cyber zodpovedal na 98,5 percenta bezpečnostných otázok, ktoré iné modely zablokovali, a odhalil dve dovtedy neznáme chyby v Chrome.
  • Claude má podľa zverejnenej informácie ponechať cenu Claude Sonnet 5 na úrovni 2 doláre za milión vstupných a 10 dolárov za milión výstupných tokenov.
  • MarkTechPost píše o otvorenom modeli NVIDIA NemotronLabs VoiceChat 11B s uvádzanou odozvou približne 448 milisekúnd a podporou živého volania nástrojov.
  • Výskum na arXiv upozorňuje, že pridanie výpočtového výkonu jednému LLM hodnotiteľovi nemusí zlepšiť kontrolu všetkých požiadaviek v jedinom volaní.
  • Wired opisuje nástup AI pracovných pohovorov, ktoré uchádzači absolvujú aj o jednej hodine ráno, pretože na druhej strane často nie je človek.

Čo si o tom myslím a čo z toho plynie pre firmy

Názor

Otvorené modely vítam, ale nie preto, že slovo „open“ dobre vyzerá v prezentácii. Podstatné je, či model beží každý deň, stojí menej a firma vie, čo sa stane s jej dátami. Muse Glimmer je zaujímavý tým, že sa pokúša dostať inferenciu, teda generovanie odpovede, bližšie k zariadeniu používateľa. To však ešte nie je výsledok. Výsledkom bude až stabilná prevádzka konkrétnej úlohy.

Pri podobných správach sa pozerám na náklady mimo cenníka. Lokálny model neplatí za API volanie, ale potrebuje pamäť, grafickú kartu, aktualizácie a dohľad. Ak firma kúpi hardvér a nikto nesleduje kvalitu odpovedí, nevznikla úspora. Vznikol ďalší server, ktorý má na porade pekný názov.

Výsledok FineBooks ukazuje rovnaký princíp z druhej strany. Model s 0,9 miliardy parametrov sa v teste priblížil k výsledku oveľa väčšieho modelu a pracoval lacnejšie. Otázka „ktorý model je najlepší“ je preto pre firmu slabá. Správna otázka znie, ktorý model je dosť dobrý na našu úlohu, naše dáta a náš rozpočet. Benchmark nie je prevádzka a 97,6 percenta nie je 100 percent.

Dôsledok pre slovenskú a českú firmu

Pre bežnú stredoeurópsku firmu sa mení hlavne rozhodovací proces. IT a bezpečnosť by nemali vyberať model iba podľa rebríčka. Obchod potrebuje vedieť, či odpovede skrátia prípravu ponuky. Zákaznícka podpora potrebuje vedieť, či klesne počet ručných zásahov. Finančné oddelenie potrebuje poznať cenu za jednu vyriešenú požiadavku, nie iba cenu tokenov.

V najbližších troch mesiacoch dáva zmysel vybrať jednu úlohu s citlivými dátami alebo vysokým objemom. Môže ísť o triedenie dokumentov, interné vyhľadávanie alebo sumarizáciu servisných záznamov. Tú istú vzorku spustite cez súčasné API a cez lokálny model. Merajte presnosť, čas, cenu a počet zásahov človeka.

Na Slovensku aj v Česku bude technický postup podobný. Rozdiel môže vzniknúť pri odvetvových pravidlách, zmluvách so zákazníkmi a požiadavkách na uchovávanie údajov. Firma nemusí čakať na dokonalý otvorený model. Potrebuje vedieť, ktoré dáta dnes zbytočne posiela mimo vlastnej kontroly a koľko ju to stojí.

Pri OCR je potrebná ešte väčšia disciplína. Ak ide o interné vyhľadávanie v archíve, lacnejší model môže byť vhodný. Ak ide o faktúry, zmluvy alebo historické dokumenty, treba zaviesť prah dôvery, kontrolnú vzorku a eskaláciu k človeku. Automatizácia nesmie potichu meniť význam dokumentu.

Najväčšia výhoda otvorených modelov preto nie je samotná licencia. Je to možnosť porovnať viac prevádzkových scenárov a nebyť odkázaný na jedného dodávateľa. Najväčšie riziko je opačné. Firma si pomýli dostupný model s hotovým systémom a preskočí meranie, monitorovanie aj plán odchodu.

Na záver

ByteDance vypol v Číne AI spoločnícke služby a jedna používateľka podľa Fast Company oplakávala koniec viac než 700-tisíc slov dlhej konverzácie s AI partnerom. Číslo pôsobí absurdne iba dovtedy, kým si neuvedomíme, že ľudia si nevytvárajú vzťah k modelu, ale k histórii interakcií. Cloudová služba môže byť technicky lacná a emocionálne nenahraditeľná. Aj preto má mať firma pri AI systéme plán zálohy, exportu a ukončenia. Používateľ totiž licenčné podmienky číta až vtedy, keď služba zmizne.

Výzva na AI implementáciu dňa

Do týždňa nasaďte porovnávací test lokálneho a cloudového modelu na 100 anonymizovaných dokumentoch. Ako lokálny kandidát použite Muse Glimmer, ak máte kompatibilnú spotrebiteľskú GPU. Inak vyberte menší otvorený model. Ako cloudový kandidát použite službu, ktorú už firma platí.

Test zoberie časť práce z rúk IT alebo administratíve. Výsledky zapisujte do jednej tabuľky: presnosť, čas, cena a počet opráv. Príprava zaberie približne 2 až 5 pracovných dní. Ušetrí vám najmä týždne nesprávneho výberu, nie okamžite celý rozpočet. Najčastejšie padne na nekvalitnej testovacej vzorke alebo na tom, že nikto neurčí prijateľnú chybu.

Vyberte 100 reálnych prípadov, zmerajte oba scenáre a rozhodnite sa podľa prevádzkových dát, nie podľa počtu parametrov.