Claude zvládol časť návrhu liekov s úspešnosťou nad bežným priemerom
Anthropic zverejnil dva experimenty, v ktorých modely Claude riadili úlohy z raného vývoja liekov. V prvom navrhovali minibinders, teda malé proteíny, ktoré sa pevne naviažu na cieľový proteín a zmenia alebo zablokujú jeho funkciu. Na podobnom princípe fungujú viaceré biologické lieky.
Systém Mythos Preview a Opus 4.8 pracoval so 16 cieľovými proteínmi. Pri 15 z nich vznikli použiteľné laboratórne merania. Celkovo sa testovalo 1 320 návrhov a 354 sa skutočne naviazalo na cieľ. To predstavuje úspešnosť 26,8 %.
Anthropic uvádza, že v súčasných verejne zdokumentovaných kampaniach sa bežná úspešnosť pohybuje približne medzi 10 % a 15 %. Tento údaj čerpá z databázy ProteinBase. Porovnanie však pochádza z materiálu samotného Anthropic a rôzne kampane nemusia používať rovnaké ciele, protokoly ani kritériá úspechu.
Najlepší návrh z rebríčka modelu dosiahol úspešnosť 49 %. Pri spracovaní všetkých cieľov naraz za 48 hodín dosiahol Mythos Preview 26,7 % a Opus 4.8 22,6 %. Keď Mythos riešil každý cieľ samostatne, výsledok stúpol na 35,1 %. Cena za to bola 2,8-násobný výpočtový rozpočet na jeden cieľ.
Claude pritom nebol vytvorený ako špecializovaný proteínový model. Agent spúšťal viac ako desať otvorených nástrojov, ktoré vedci používajú už dnes. Návrhy kostier proteínov vznikali napríklad cez PXDesign, RFdiffusion3, Genie 3 alebo BoltzGen. Sekvencie aminokyselín a následné filtrovanie zabezpečovali ďalšie nástroje.
Celý proces stále vyžadoval ľudí. Tí vybrali ciele, pripravili systémové zadanie, objednali syntézu a interpretovali výsledky meraní. Multi-target kampaň stála podľa reportu 50 000 dolárov a experiment s jedným cieľom 10 000 dolárov, pričom výpočty bežali cez Modal.
Výsledky neboli rovnomerné. Pri TREM2 sa naviazalo 72 z 90 návrhov, pri VEGF-A 54 z 90. Naopak, pri MBP nefungoval ani jeden z 90 návrhov. Pri umelo vytvorenom proteíne BBF-14 uspeli iba tri slabé návrhy. Predikčné skóre pritom tieto zlyhania vopred spoľahlivo neodhalilo.
Anthropic v technickom opise experimentov uvádza, že nezávislé preskúmanie výsledkov ešte len príde. To je zásadná poznámka. Väzba na proteín je úspech v laboratórnom teste, nie dôkaz bezpečnosti, účinnosti alebo použiteľnosti lieku u človeka.
Čo si z toho zobrať? Pre slovenskú a českú firmu z biotechnológií je to signál na pilot s jasným laboratórnym meraním, nie dôvod na nákup „AI výskumníka“ bez odborného tímu. Rozpočet, počet testov a kvalitu výsledku treba oddeliť od marketingového tvrdenia o úspešnosti.
Súboj OpenAI a Anthropic sa presúva k súkromiu firemných dát
OpenAI predstavilo pre vybraných zákazníkov Private Safety Processing. Ide o systém, ktorý má sledovať možné zneužitie modelov bez uchovávania zákazníckych dát. Podľa TechCrunch má monitorovať dlhšie vzorce správania naprieč viacerými konverzáciami, nielen jednu reláciu.
To je rozdiel oproti bežnému Zero Data Retention, teda režimu bez uchovávania dát. Ak systém zachytí podozrivý vzorec, OpenAI má odoslať iba úzko definovaný signál o konkrétnom type aktivity. Ľudské preskúmanie obsahu nemá byť automatickým krokom.
Anthropic zase pri vybraných modeloch zaviedol 30-dňové uchovávanie relácií na bezpečnostné účely. Ľudský prístup má prebiehať cez kontrolovaný proces a byť zaznamenaný v protokole, ktorý sa nedá spätne meniť. Pre firmy s citlivými dátami je však rozdiel medzi „dáta neuchovávame“ a „uchovávame ich obmedzený čas“ praktický, nie slovný.
Čo si z toho zobrať? Pri výbere API si vypýtajte presný dátový tok, dobu uchovávania, podmienky ľudského prístupu a spôsob auditu. Pre slovenskú a českú firmu je to podklad pre právnika, bezpečnostného človeka aj nákup, nie iba pre tím, ktorý si chce vyskúšať nový model.
Čo ešte stojí za prečítanie?
- Programátori tvrdia, že spôsoby obídenia neviditeľných vodoznakov v Claude zverejnili už v priebehu hodín, informuje WIRED.
- Meta zobrazovala reklamu na aplikáciu sľubujúcu „vyzliekanie“ političiek a jeden inzerát obsahoval pornografický deepfake, uvádza Ars Technica.
- Google a britská vláda chcú AI využívať na presmerovanie lietadiel s cieľom obmedziť kondenzačné pruhy, píše Engadget.
- Proti výstavbe dátových centier sa 18. júla konalo 142 protestov v 42 štátoch USA, podľa Fast Company.
- Programovací jazyk Mojo sa po vydaní verzie 1.0 stal open source, hoci otvorenie bolo sľubované už od roku 2023, upozorňuje Simon Willison.
Čo si o tom myslím a čo z toho plynie pre firmy
Názor
Anthropic ukázal zaujímavý pracovný systém, nie autonómneho vedca. To je podľa mňa presnejší a užitočnejší opis. Model spojil existujúce špecializované nástroje, dodržal dlhé zadanie a v niektorých prípadoch vybral návrhy, ktoré sa v laboratóriu uchytili. Hodnota teda nevznikla tým, že Claude „vymyslel liek“. Vznikla orchestráciou krokov, ktoré už niekto vedel opísať a zmerať.
Číslo 35,1 % vyzerá pôsobivo, ale nedá sa oddeliť od vyššieho výpočtového rozpočtu na jeden cieľ. Navyše ho uvádza firma, ktorá experiment pripravila, vybrala metodiku a porovnávaciu základňu. Kým príde nezávislá replikácia, bral by som výsledok ako sľubný benchmark, nie ako nový priemyselný štandard. V biológii sa výsledok nekončí grafom. Končí sa až vtedy, keď prežije ďalšie testy, inú laboratórnu skupinu a napokon reguláciu.
Dôsledok pre slovenskú a českú firmu
Pre bežnú stredoeurópsku firmu z toho vyplýva jednoduché pravidlo. AI sa oplatí nasadiť tam, kde existuje opakovateľný proces, dostupné dáta a kontrolné meranie. V tomto prípade môže agent pomôcť napríklad pri príprave kandidátov, spúšťaní predikčných nástrojov, triedení výsledkov alebo čítaní laboratórnych súborov. Nemá však sám rozhodovať o tom, čo sa dostane do ďalšej fázy vývoja.
Zaujímavý je aj druhý experiment Anthropic. Claude mal z raw súborov NMR a LC-MS pripraviť analýzu za 23, respektíve 19 minút. Pri LC-MS si dokonca sám dekódoval formát, ku ktorému nenašiel vhodný čítač. Takéto použitie je pre firmu praktickejšie než veľké tvrdenie o objave nového lieku. Ak odborník dnes venuje analýze každého súboru hodiny, automatizovaný prvý priechod môže uvoľniť kapacitu bez toho, aby firma odovzdala rozhodovanie modelu.
V horizonte jedného až troch mesiacov by som preto meral tri veci: čas od vstupu dát po prvý návrh, počet chýb pri kontrole a koľko práce zostane odborníkovi po automatizácii. Úspora času sa počíta až vtedy, keď ho tím využije na ďalšie experimenty alebo zákaznícku prácu. Ak len skráti pracovný deň a proces zostane rovnaký, firma nemá úsporu, iba tichší kalendár.
Druhou témou je súkromie. Súboj OpenAI a Anthropic ukazuje, že bezpečnosť už nie je iba otázka toho, či model odpovie na zakázanú požiadavku. Je to aj otázka, čo sa deje s firemným kontextom medzi jednotlivými požiadavkami. Nákup musí preto porovnať technické nastavenie, zmluvu, regionálne spracovanie dát a možnosť auditu. To platí pre slovenskú aj českú firmu. Konkrétne povinnosti sa môžu líšiť podľa sektorovej regulácie a typu osobných údajov, ale základný proces kontroly má byť rovnaký.
Najväčšie riziko nie je, že firma vyberie o niečo slabší model. Väčšie riziko je, že kúpi nástroj bez merania a bez plánu, kto skontroluje jeho zlyhanie. Pri agentoch navyše treba počítať s údržbou po zmene API, knižnice alebo formátu súborov. Systém, ktorý zlyhá potichu, je horší než systém, ktorý sa zastaví a pošle upozornenie. Aj biotechnologický pilot preto potrebuje prevádzkový monitoring, vlastníka procesu a jasnú hranicu, za ktorou rozhoduje človek.
Čo si z toho zobrať? Najbližší firemný krok nemá byť výber najlepšieho modelu. Má ním byť výber jedného procesu, ktorý sa dá zmerať pred nasadením aj po ňom, vrátane času, chýb, nákladov a pravidiel práce s dátami.
Na záver
Google posúva Gemini smerom k študijnému hubu, ktorý kombinuje výskumné zápisníky, kartičky, kvízy, grafy a vysvetľovanie úloh cez fotoaparát. The Verge opisuje aj prácu so sylabami a termínmi v kalendári. Je to pripomienka, že užitočná AI nemusí pôsobiť ako robotický génius. Niekedy stačí, keď študentovi vysvetlí chybu skôr, než ju odovzdá. To je menej filmové, ale zato použiteľné.
Výzva na AI implementáciu dňa
Do týždňa si nasaďte automatizovaný prvý priechod nad jedným typom firemných súborov. Prakticky môže ísť o PDF protokoly, výsledky meraní alebo pravidelné reporty. Pomocou n8n, bezpečného API modelu a šablóny výstupu nech systém vytiahne hodnoty, označí chýbajúce údaje a pošle odborníkovi návrh zhrnutia na kontrolu.
Administratíve alebo analytikovi to zoberie opakované prepisovanie a triedenie. Pri 20 súboroch týždenne môže ísť o 2 až 4 hodiny práce, pričom jednoduchý pilot sa dá spustiť za 3 až 5 pracovných dní. Zlyháva to najčastejšie na nejednotných formátoch a na tom, že nikto nekontroluje, keď sa zmení štruktúra vstupu.
Vyberte jeden formát, zmerajte dnešný čas a prvý pracovný týždeň ho nechajte prejsť automatizáciou s ľudským schválením.
