Claude zvládl část návrhu léčiv s úspěšností nad běžným průměrem
Anthropic zveřejnil dva experimenty, ve kterých modely Claude řídily úkoly z raného vývoje léčiv. V prvním navrhovaly minibinders, tedy malé proteiny, které se pevně navážou na cílový protein a změní nebo zablokují jeho funkci. Na podobném principu funguje několik biologických léčiv.
Systémy Mythos Preview a Opus 4.8 pracovaly se 16 cílovými proteiny. U 15 z nich vznikla použitelná laboratorní měření. Celkem se testovalo 1 320 návrhů a 354 se skutečně navázalo na cíl. To představuje úspěšnost 26,8 %.
Anthropic uvádí, že v současných veřejně zdokumentovaných kampaních se běžná úspěšnost pohybuje přibližně mezi 10 % a 15 %. Tento údaj čerpá z databáze ProteinBase. Porovnání však pochází z materiálu samotného Anthropic a různé kampaně nemusí používat stejné cíle, protokoly ani kritéria úspěchu.
Nejlepší návrh z žebříčku modelu dosáhl úspěšnosti 49 %. Při zpracování všech cílů najednou za 48 hodin dosáhl Mythos Preview 26,7 % a Opus 4.8 22,6 %. Když Mythos řešil každý cíl samostatně, výsledek vzrostl na 35,1 %. Cenou za to byl 2,8násobný výpočetní rozpočet na jeden cíl.
Claude přitom nebyl vytvořen jako specializovaný proteinový model. Agent spouštěl více než deset otevřených nástrojů, které vědci používají už dnes. Návrhy struktur proteinů vznikaly například prostřednictvím PXDesign, RFdiffusion3, Genie 3 nebo BoltzGen. Sekvence aminokyselin a následné filtrování zajišťovaly další nástroje.
Celý proces stále vyžadoval lidi. Ti vybrali cíle, připravili systémové zadání, objednali syntézu a interpretovali výsledky měření. Multicilová kampaň stála podle reportu 50 000 dolarů a experiment s jedním cílem 10 000 dolarů, přičemž výpočty běžely přes Modal.
Výsledky nebyly rovnoměrné. U TREM2 se navázalo 72 z 90 návrhů, u VEGF-A 54 z 90. Naopak u MBP nefungoval ani jeden z 90 návrhů. U uměle vytvořeného proteinu BBF-14 uspěly pouze tři slabé návrhy. Predikční skóre přitom tato selhání předem spolehlivě neodhalilo.
Anthropic v technickém popisu experimentů uvádí, že nezávislé přezkoumání výsledků teprve přijde. To je zásadní poznámka. Vazba na protein je úspěchem v laboratorním testu, nikoli důkazem bezpečnosti, účinnosti nebo použitelnosti léčiva u člověka.
Co si z toho odnést? Pro slovenskou a českou biotechnologickou firmu je to signál k pilotnímu projektu s jasným laboratorním měřením, nikoli důvod k nákupu „AI výzkumníka“ bez odborného týmu. Rozpočet, počet testů a kvalitu výsledku je třeba oddělit od marketingového tvrzení o úspěšnosti.
Souboj OpenAI a Anthropic se přesouvá k soukromí firemních dat
OpenAI představilo vybraným zákazníkům Private Safety Processing. Jde o systém, který má sledovat možné zneužití modelů bez uchovávání zákaznických dat. Podle TechCrunch má monitorovat delší vzorce chování napříč více konverzacemi, nikoli pouze jednu relaci.
To je rozdíl oproti běžnému Zero Data Retention, tedy režimu bez uchovávání dat. Pokud systém zachytí podezřelý vzorec, OpenAI má odeslat pouze úzce definovaný signál o konkrétním typu aktivity. Kontrola obsahu člověkem nemá být automatickým krokem.
Anthropic zase u vybraných modelů zavedl 30denní uchovávání relací pro bezpečnostní účely. Lidský přístup má probíhat prostřednictvím kontrolovaného procesu a být zaznamenán v protokolu, který nelze zpětně měnit. Pro firmy s citlivými daty je však rozdíl mezi „data neuchováváme“ a „uchováváme je omezenou dobu“ praktický, nikoli pouze slovní.
Co si z toho odnést? Při výběru API si vyžádejte přesný tok dat, dobu uchovávání, podmínky lidského přístupu a způsob auditu. Pro slovenskou a českou firmu je to podklad pro právníka, bezpečnostního pracovníka i nákup, nikoli pouze pro tým, který si chce vyzkoušet nový model.
Co ještě stojí za přečtení?
- Programátoři tvrdí, že způsoby, jak obejít neviditelné vodoznaky v Claude, zveřejnili už během několika hodin, informuje WIRED.
- Meta zobrazovala reklamu na aplikaci slibující „svlékání“ političek a jeden inzerát obsahoval pornografický deepfake, uvádí Ars Technica.
- Google a britská vláda chtějí AI využívat k přesměrování letadel s cílem omezit kondenzační pruhy, píše Engadget.
- Proti výstavbě datových center se 18. července konalo 142 protestů ve 42 státech USA, podle Fast Company.
- Programovací jazyk Mojo se po vydání verze 1.0 stal open source, přestože otevření bylo slíbeno už od roku 2023, upozorňuje Simon Willison.
Co si o tom myslím a co z toho plyne pro firmy
Názor
Anthropic ukázal zajímavý pracovní systém, nikoli autonomního vědce. To je podle mě přesnější a užitečnější popis. Model propojil existující specializované nástroje, dodržel dlouhé zadání a v některých případech vybral návrhy, které se v laboratoři uchytily. Hodnota tedy nevznikla tím, že Claude „vymyslel léčivo“. Vznikla orchestrací kroků, které už někdo uměl popsat a změřit.
Číslo 35,1 % vypadá působivě, ale nelze ho oddělit od vyššího výpočetního rozpočtu na jeden cíl. Navíc ho uvádí firma, která experiment připravila, zvolila metodiku a vybrala srovnávací základnu. Než přijde nezávislá replikace, považoval bych výsledek za slibný benchmark, nikoli za nový průmyslový standard. V biologii výsledek nekončí grafem. Končí až tehdy, když obstojí v dalších testech, před jinou laboratorní skupinou a nakonec i před regulací.
Důsledek pro slovenskou a českou firmu
Pro běžnou středoevropskou firmu z toho vyplývá jednoduché pravidlo. AI se vyplatí nasadit tam, kde existuje opakovatelný proces, dostupná data a kontrolní měření. V tomto případě může agent pomoci například s přípravou kandidátů, spouštěním predikčních nástrojů, tříděním výsledků nebo čtením laboratorních souborů. Neměl by však sám rozhodovat o tom, co postoupí do další fáze vývoje.
Zajímavý je i druhý experiment Anthropic. Claude měl ze surových souborů NMR a LC-MS připravit analýzu za 23, respektive 19 minut. U LC-MS si dokonce sám dekódoval formát, ke kterému nenašel vhodnou čtečku. Takové použití je pro firmu praktičtější než velké tvrzení o objevu nového léčiva. Pokud odborník dnes věnuje analýze každého souboru hodiny, automatizovaný první průchod může uvolnit kapacitu, aniž by firma předala rozhodování modelu.
V horizontu jednoho až tří měsíců bych proto měřil tři věci: čas od vstupu dat k prvnímu návrhu, počet chyb při kontrole a kolik práce zůstane odborníkovi po automatizaci. Úspora času se počítá až tehdy, když ho tým využije na další experimenty nebo zákaznickou práci. Pokud pouze zkrátí pracovní den a proces zůstane stejný, firma nemá úsporu, jen tišší kalendář.
Druhou tématikou je soukromí. Souboj OpenAI a Anthropic ukazuje, že bezpečnost už není jen otázkou toho, zda model odpoví na zakázaný požadavek. Je to také otázka, co se děje s firemním kontextem mezi jednotlivými požadavky. Nákup proto musí porovnat technické nastavení, smlouvu, regionální zpracování dat a možnost auditu. To platí pro slovenskou i českou firmu. Konkrétní povinnosti se mohou lišit podle sektorové regulace a typu osobních údajů, základní proces kontroly by však měl být stejný.
Největším rizikem není, že firma vybere o něco slabší model. Větším rizikem je, že koupí nástroj bez měření a bez plánu, kdo zkontroluje jeho selhání. U agentů je navíc třeba počítat s údržbou po změně API, knihovny nebo formátu souborů. Systém, který selže potichu, je horší než systém, který se zastaví a odešle upozornění. I biotechnologický pilot proto potřebuje provozní monitoring, vlastníka procesu a jasnou hranici, za kterou rozhoduje člověk.
Co si z toho odnést? Nejbližším firemním krokem nemá být výběr nejlepšího modelu. Měl by jím být výběr jednoho procesu, který lze změřit před nasazením i po něm, včetně času, chyb, nákladů a pravidel práce s daty.
Na závěr
Google posouvá Gemini směrem ke studijnímu hubu, který kombinuje výzkumné zápisníky, kartičky, kvízy, grafy a vysvětlování úloh prostřednictvím fotoaparátu. The Verge popisuje také práci se sylaby a termíny v kalendáři. Je to připomínka, že užitečná AI nemusí působit jako robotický génius. Někdy stačí, když studentovi vysvětlí chybu dřív, než ji odevzdá. To je méně filmové, ale zato použitelné.
Výzva k AI implementaci dne
Do týdne nasaďte automatizovaný první průchod nad jedním typem firemních souborů. Prakticky může jít o PDF protokoly, výsledky měření nebo pravidelné reporty. Pomocí n8n, bezpečného API modelu a šablony výstupu nechte systém vytáhnout hodnoty, označit chybějící údaje a poslat odborníkovi návrh shrnutí ke kontrole.
Administrativě nebo analytikovi to ušetří opakované přepisování a třídění. U 20 souborů týdně může jít o 2 až 4 hodiny práce, přičemž jednoduchý pilot lze spustit za 3 až 5 pracovních dní. Nejčastěji selhává na nejednotných formátech a na tom, že nikdo nekontroluje změny ve struktuře vstupu.
Vyberte jeden formát, změřte dnešní čas a během prvního pracovního týdne ho nechte projít automatizací s lidským schválením.
