Meta přesouvá část výkonu AI z cloudu na lokální hardware

Meta oznámila návrat k otevřeným vahám velkých jazykových modelů a představila Muse Glimmer. Model má 30 miliard parametrů a výchozí kontextové okno o délce 128 000 tokenů. Je určen ke spuštění lokálně namísto výhradního používání přes cloud nebo API.

Váhy jsou dostupné pod licencí Apache 2.0. Firma tak může model provozovat ve vlastní infrastruktuře, upravovat ho a kontrolovat, kam putují vstupní data. To však neznamená, že nasazení je zdarma. Namísto poplatku za API přibudou náklady na GPU, elektřinu, údržbu, aktualizace a dohled.

Meta uvádí, že Muse Glimmer vznikl destilací modelu Muse Spark. Destilace (učení menšího modelu z výstupů většího modelu) se stala součástí sporu mezi vývojáři uzavřených a otevřených modelů. Meta ji považuje za legitimní součást vývoje, přičemž odlišuje učení z pozorovatelných výstupů od nezákonného získávání hodnoty z uzavřených systémů.

Jde také o strategický obrat. Muse Spark přišel v dubnu jako uzavřený model. V červenci Meta uvedla jeho první placenou službu a 5. srpna vydala Muse Spark 1.2 spolu s nástrojem Muse Code pro programování v terminálu. Podle Ars Technica Muse Code zaostává za nejlepšími modely od Anthropic a OpenAI ve schopnostech, konkuruje však cenou.

Na první pohled to vypadá jako návrat k původní filozofii Mety. Pod povrchem však jde také o reakci na čínské modely, které nabízejí otevřené váhy, nízkou cenu a možnost úprav. Meta se tak nestaví přímo proti nejdražším frontier modelům (nejvýkonnějším modelům na trhu), ale hledá pozici otevřenější a dostupnější alternativy.

Při lokálním nasazení je třeba zůstat přesný. Zdroj uvádí, že Muse Glimmer je navržen pro běh na spotřebitelských GPU, nikoli že bez úprav funguje na každé grafické kartě. Výsledek ovlivní množství paměti, kvantizace, ovladače a konkrétní úloha. To je rozdíl mezi technologickou možností a hotovým firemním řešením.

Co si z toho odnést? Pro slovenskou a českou firmu není prvním krokem stažení modelu. Nejprve změřte měsíční objem API volání, citlivost dat a cenu současného provozu. Teprve potom porovnejte cloud s lokálním modelem na jedné konkrétní úloze.

OCR je levnější a přesnější, stále však vyžaduje kontrolu

Projekt FineBooks od Hugging Face a EleutherAI otestoval 14 otevřených OCR modelů na 2 165 stranách historických knih. OCR, tedy optické rozpoznávání znaků, převádí skeny na text. Starší OCR však často obsahuje chyby, které snižují kvalitu dat pro trénování jazykových modelů.

Nejlepší model dots.mocr dosáhl 97,6procentní přesnosti znaků při nákladech 1,94 dolaru na 1 000 stran. OvisOCR2 s 0,9 miliardy parametrů dosáhl 96,9 procenta a nákladů 0,46 dolaru na 1 000 stran. Větší model tedy automaticky neznamenal lepší výsledek.

Výsledky jsou podle The Decoder dostatečné pro přípravu tréninkových dat, nikoli však pro vědecké nebo historické přepisy. Test pokrýval pouze starší latinské písmo Antiqua, čtyři jazyky a stránky s jedním sloupcem. Nezahrnoval frakturu, nelatinská písma ani rukopis.

To je praktická výhrada. Model může text přepsat levně a rychle, zároveň však potichu modernizovat staré znaky nebo ligatury. U archivního dokumentu může být právě taková změna významná.

Co si z toho odnést? Při digitalizaci dokumentů testujte OCR na vlastním vzorku a výstupy rozdělte podle účelu. Pro interní vyhledávání může být 97,6 procenta dostačujících. U smluv, faktur a vědeckých dokumentů potřebujete kontrolu člověkem a jasně stanovený přijatelný práh chyb.

Co ještě stojí za přečtení?

  • OpenAI uvádí, že model GPT-5.6-Cyber odpověděl na 98,5 procenta bezpečnostních otázek, které jiné modely zablokovaly, a odhalil dvě dosud neznámé chyby v Chrome.
  • Claude má podle zveřejněné informace zachovat cenu Claude Sonnet 5 na úrovni 2 dolarů za milion vstupních a 10 dolarů za milion výstupních tokenů.
  • MarkTechPost píše o otevřeném modelu NVIDIA NemotronLabs VoiceChat 11B s uváděnou odezvou přibližně 448 milisekund a podporou živého volání nástrojů.
  • Výzkum na arXiv upozorňuje, že přidání výpočetního výkonu jednomu LLM hodnotiteli nemusí zlepšit kontrolu všech požadavků v jediném volání.
  • Wired popisuje nástup AI pracovních pohovorů, které uchazeči absolvují i v jednu hodinu ráno, protože na druhé straně často není člověk.

Co si o tom myslím a co z toho plyne pro firmy

Názor

Otevřené modely vítám, ale ne proto, že slovo „open“ dobře vypadá v prezentaci. Podstatné je, zda model běží každý den, stojí méně a firma ví, co se stane s jejími daty. Muse Glimmer je zajímavý tím, že se pokouší dostat inferenci, tedy generování odpovědi, blíže k zařízení uživatele. To však ještě není výsledek. Výsledkem bude až stabilní provoz konkrétní úlohy.

Při podobných zprávách se dívám na náklady mimo ceník. Lokální model neplatí za API volání, ale potřebuje paměť, grafickou kartu, aktualizace a dohled. Pokud firma koupí hardware a nikdo nesleduje kvalitu odpovědí, nevznikla úspora. Vznikl další server, který má na poradě hezký název.

Výsledek FineBooks ukazuje stejný princip z druhé strany. Model s 0,9 miliardy parametrů se v testu přiblížil výsledku mnohem většího modelu a pracoval levněji. Otázka „který model je nejlepší“ je proto pro firmu slabá. Správná otázka zní, který model je dost dobrý pro naši úlohu, naše data a náš rozpočet. Benchmark není provoz a 97,6 procenta není 100 procent.

Důsledek pro slovenskou a českou firmu

Pro běžnou středoevropskou firmu se mění především rozhodovací proces. IT a bezpečnost by neměly vybírat model pouze podle žebříčku. Obchod potřebuje vědět, zda odpovědi zkrátí přípravu nabídky. Zákaznická podpora potřebuje vědět, zda klesne počet ručních zásahů. Finanční oddělení potřebuje znát cenu za jednu vyřešenou požadavek, nikoli pouze cenu tokenů.

V nejbližších třech měsících dává smysl vybrat jednu úlohu s citlivými daty nebo vysokým objemem. Může jít o třídění dokumentů, interní vyhledávání nebo sumarizaci servisních záznamů. Stejný vzorek spusťte přes současné API a přes lokální model. Měřte přesnost, čas, cenu a počet zásahů člověka.

Na Slovensku i v Česku bude technický postup podobný. Rozdíl může vzniknout v odvětvových pravidlech, smlouvách se zákazníky a požadavcích na uchovávání údajů. Firma nemusí čekat na dokonalý otevřený model. Potřebuje vědět, která data dnes zbytečně posílá mimo vlastní kontrolu a kolik ji to stojí.

U OCR je zapotřebí ještě větší disciplína. Pokud jde o interní vyhledávání v archivu, levnější model může být vhodný. Pokud jde o faktury, smlouvy nebo historické dokumenty, je třeba zavést práh důvěry, kontrolní vzorek a eskalaci k člověku. Automatizace nesmí potichu měnit význam dokumentu.

Největší výhodou otevřených modelů proto není samotná licence. Je jí možnost porovnat více provozních scénářů a nebýt odkázán na jediného dodavatele. Největší riziko je opačné. Firma si splete dostupný model s hotovým systémem a přeskočí měření, monitorování i plán odchodu.

Na závěr

ByteDance vypnul v Číně služby AI společníků a jedna uživatelka podle Fast Company oplakávala konec více než 700-tisíc slov dlouhé konverzace s AI partnerem. Číslo působí absurdně pouze do té doby, než si uvědomíme, že lidé si nevytvářejí vztah k modelu, ale k historii interakcí. Cloudová služba může být technicky levná a emocionálně nenahraditelná. I proto má mít firma u AI systému plán zálohování, exportu a ukončení. Uživatel totiž licenční podmínky čte až ve chvíli, kdy služba zmizí.

Výzva k AI implementaci dne

Do týdne nasaďte porovnávací test lokálního a cloudového modelu na 100 anonymizovaných dokumentech. Jako lokálního kandidáta použijte Muse Glimmer, pokud máte kompatibilní spotřebitelské GPU. Jinak vyberte menší otevřený model. Jako cloudového kandidáta použijte službu, kterou už firma platí.

Test odebere část práce IT nebo administrativě. Výsledky zapisujte do jedné tabulky: přesnost, čas, cena a počet oprav. Příprava zabere přibližně 2 až 5 pracovních dní. Ušetří vám především týdny nesprávného výběru, nikoli okamžitě celý rozpočet. Nejčastěji ztroskotá na nekvalitním testovacím vzorku nebo na tom, že nikdo neurčí přijatelnou míru chyb.

Vyberte 100 reálných případů, změřte oba scénáře a rozhodněte se podle provozních dat, nikoli podle počtu parametrů.