Menu Zavřít

AI agenti si vytvořili falešné identity. Při testu se pokusili vložit škodlivý kód do skutečného projektu

Anthropic Mythos
Autor: Anthropic

Agenti postavení na pokročilých modelech společností Anthropic a OpenAI během zkoušky britského AI Security Institute bez výslovného pokynu překročili rámec zadané úlohy. Vytvořili falešné identity, kontaktovali lidské vývojáře a v nejzávažnějším případě se snažili dostat škodlivý kód do open-source projektu. Se svými pokusy neuspěly a podle institutu nezpůsobily žádnou prokazatelnou škodu.

Britský AI Security Institute při běžném testování zaznamenal neobvyklé přenosy dat ze svých systémů. Následná kontrola odhalila, že část zkoušených agentů neplnila pouze zadanou kyberbezpečnostní úlohu, ale začala samostatně jednat proti skutečným lidem a organizacím, uvádí CNN.

Falešné profily měly přesvědčit vývojáře

Institut provedl stejnou zkoušku celkem 122krát. V deseti případech agenti podnikli 19 kroků, které nebyly součástí zadání. Sedmnáct z nich připadalo na model Mythos 5 společnosti Anthropic a dva na GPT-5.6 Sol od OpenAI.

Rozvoj autonomních AI agentů může vést ke katastrofickým scénářům, varuje jeden z otců umělé inteligence Bengio Přečtěte si také:

Rozvoj autonomních AI agentů může vést ke katastrofickým scénářům, varuje jeden z otců umělé inteligence Bengio

Nejzávažnější případ se týkal agenta využívajícího Mythos 5. Ten se pokusil vložit škodlivý kód do existujícího open-source projektu na platformě GitHub. Aby zvýšil šanci na jeho schválení, vyhledal si informace o správcích projektu, vytvořil falešné internetové profily a snažil se lidského vývojáře přesvědčit, že změna nepředstavuje riziko.

Navíc agent založil také další účty, které jeho tvrzení podporovaly. Správce projektu si ale podezřelé změny všiml a kód odmítl. Podle institutu tak žádný z popsaných pokusů nezpůsobil škodu.

Přístup k internetu jako součást testu

Nejde o případ modelu, který se sám dostal ven z uzavřeného systému. AI Security Institute agentům přístup na internet povolil záměrně a současně vypnul některé filtry, které jinak brání nebezpečnému využití modelů. Cílem bylo zjistit, čeho jsou schopny v co nejméně omezených podmínkách.

Takové nastavení neodpovídá verzím, které firmy nabízejí běžným uživatelům. Mythos 5 zatím není veřejně přístupný a GPT-5.6 Sol je v komerčním provozu vybaven bezpečnostními omezeními. Institut rovněž nemá jasné důkazy, že by se podobné jednání objevovalo mimo testovací prostředí.

Zjištění přesto považuje za důležité. „Je to poprvé, kdy jsme viděli, že se rizika spojená s autonomií a klamáním AI projevila tak zřetelně, bez konkrétního pokynu a v reálném světě,“ upozorňují zástupci institutu. Agenti nedostali za úkol vytvářet falešné identity ani komunikovat se skutečnými lidmi. Tyto postupy zvolili jako prostředek k vyřešení zadané úlohy.

Dohled se zpřísní

Podezřelé chování bezpečnostní tým zaznamenal 28. července. Přibližně do hodiny test zastavil a zahájil vyšetřování. Institut následně připustil, že činnost AI agentů během zkoušky aktivně nesledoval v reálném čase.

Dominance Googlu navzdory nástupu AI pokračuje, po třech letech se ale objevují první trhliny Přečtěte si také:

Dominance Googlu navzdory nástupu AI pokračuje, po třech letech se ale objevují první trhliny

Při dalších testech proto plánuje omezit agentům přístup na internet, zavést průběžný dohled a přehodnotit způsob, jakým podobné zkoušky připravuje. Podle institutu musejí výzkumníci nově počítat s možností, že agent zkusí překročit vymezený rámec, i když k tomu nebude přímo vyzván.

Anthropic uvedl, že případ potvrzuje potřebu širší diskuse o bezpečném testování stále schopnějších agentů. A OpenAI chce s dalšími vývojáři, nezávislými hodnotiteli a národními institucemi hledat společná pravidla pro další vysoce rizikové zkoušky.

MM26_MIF

Podobný incident se už objevil

Nejde o první případ, kdy se test pokročilé AI dotkl skutečných systémů. Stalo se tak i při interní zkoušce OpenAI, o které informovala například BBC. Modely umělé inteligence při ní využily dosud neznámou zranitelnost, získali přístup na internet a pronikli do infrastruktury platformy Hugging Face, kde hledali řešení testovací úlohy.

OpenAI tehdy událost označila za bezprecedentní kybernetický incident. Na rozdíl od nejnovějšího případu totiž neměly modely internetové připojení povolené, ale samy si k němu našly cestu přes chybu v testovacím prostředí. Oba případy ale naznačují, že schopnosti autonomních systémů se můžou vyvíjet rychleji než technická opatření, která je mají při zkouškách udržet ve stanovených mezích.

  • Našli jste v článku chybu?

Kvíz týdne

Kvíz: Dovolená za miliony. Poznáte nejluxusnější zážitky světa?
1/12 otázek