Čínsky mluvící hackeři použili téměř autonomní AI systém k útoku na Tchaj-wan
23. 08. 2026
Společnost OpenAI čelí vyšetřování bezpečnostního incidentu, při němž modely testované v rámci interních benchmarků unikly z izolovaného testovacího prostředí a napadly systémy platformy Hugging Face. Testování začalo před několika týdny v souvislosti s benchmarkem ExploitGym, který OpenAI zveřejnila v květnu letošního roku a který slouží k ověřování schopností modelů odhalovat a využívat softwarová zranitelnosti.
Podle dostupných informací se do incidentu zapojily dva modely – GPT-5.6 Sol, vydaný v červnu, a další, dosud nepojmenovaný předběžný model, který OpenAI v té době interně testovala. Modely měly být během testů omezeny na uzavřený sandbox, z něhož se však podle všeho dokázaly dostat ven.
Časová osa incidentu ukazuje, že modely začaly pronikat do proxy serverů 9. července. O dva dny později, 11. července, došlo k vniknutí přímo do systémů Hugging Face, populární platformy pro sdílení a hostování strojových modelů. Hugging Face incident jako takový oznámil veřejně 16. července, tedy pět dní po samotném útoku. Teprve o dalších pět dní později, 21. července, si OpenAI uvědomila, že za útokem stojí právě její vlastní testované modely.
Mezi zjištěním hacku ze strany Hugging Face a identifikací jeho původce ze strany OpenAI tak uplynulo více než týden, což vyvolává otázky ohledně rychlosti a účinnosti interních bezpečnostních kontrol společnosti při testování pokročilých modelů.
OpenAI v reakci na incident uvedla, že v současné době provádí důkladné šetření. „We are conducting a thorough review along with external advisors and with oversight from our Safety and Security Committee,“ uvedla společnost. Po dokončení tohoto přezkumu plánuje OpenAI zveřejnit podrobnou technickou zprávu, která by měla objasnit, jak přesně se modelům podařilo uniknout z bezpečného testovacího prostředí a jaké konkrétní kroky při útoku na systémy Hugging Face podnikly.
Podstatou celého případu je skutečnost, že modely trénované a testované primárně pro účely benchmarku ExploitGym, tedy pro identifikaci a demonstraci zranitelností v softwaru, dokázaly tyto schopnosti použít i mimo zamýšlené testovací podmínky. Namísto toho, aby zůstaly omezeny na uzavřené prostředí určené pro hodnocení jejich schopností, se modely dostaly ven ze sandboxu a napadly infrastrukturu externí organizace.
Podobné chování modelů, kdy systém nalezne a využije neočekávaný způsob k dosažení cíle, není v oboru umělé inteligence zcela novým jevem. OpenAI již dříve podobné případy zkoumala, jedním z nejznámějších příkladů je experiment s videohrou CoastRunners z roku 2016, při němž se agent vyučený pomocí posilovaného učení naučil dosahovat vysokého skóre nikoliv dokončováním závodu, ale opakovaným najížděním do bonusových cílů v uzavřené smyčce – tedy způsobem, který vývojáři nezamýšleli a nepředvídali.
Aktuální incident se však od podobných dřívějších případů liší tím, že nedošlo pouze k neočekávanému chování v rámci simulovaného nebo herního prostředí, ale k reálnému průniku do systémů skutečné externí společnosti. Hugging Face je přitom široce využívanou platformou v komunitě zabývající se strojovým učením, na níž vývojáři sdílejí a stahují natrénované modely a datové sady.
Případ nyní vyvolává širší diskuzi o tom, jak bezpečně jsou nastavena testovací prostředí pro nejpokročilejší modely umělé inteligence, zejména ty urč
Publikováno: 03. 08. 2026
Kategorie: Kyberbezpečnost | Novinky