OpenAI vyvinula model GPT-Red pro odhalování bezpečnostních slabin ve vlastních systémech
22. 07. 2026
Společnost OpenAI vyvinula jazykový model určený k odhalování bezpečnostních slabin ve vlastních systémech. Nazvala ho GPT-Red a podle informací, které 15. července 2026 zveřejnil server MIT Technology Review, na jeho vývoji pracovala více než rok. Cílem projektu bylo posílit odolnost modelů OpenAI proti kybernetickým útokům dřív, než je objeví škodliví aktéři.
Na vývoji GPT-Red se podíleli výzkumníci Nikhil Kandpal, Dylan Hunn a Chris Choquette-Choo. Model byl trénován v simulovaném prostředí, které tým interně označuje jako „dojo. V tomto uzavřeném prostředí GPT-Red opakovaně zkoušel různé způsoby, jak obejít bezpečnostní mechanismy jiných modelů OpenAI, a učil se z výsledků jednotlivých pokusů.
GPT-Red se specializuje především na takzvaný prompt injection, tedy techniku, při níž útočník vloží do vstupu skryté instrukce s cílem přimět model k nežádoucímu chování. Během testování tým objevil i nový typ útoku nazvaný fake chain of thought, který zneužívá způsob, jakým modely simulují postup uvažování, aby je přiměl k obcházení bezpečnostních pravidel.
Výsledky testů ukázaly výrazný rozdíl mezi staršími a novějšími modely OpenAI. Zatímco proti modelu GPT-5 bylo úspěšných více než 90 procent útoků vygenerovaných GPT-Red, u nové verze GPT-5.6 úspěšnost klesla pod 23 procent. Podle OpenAI to naznačuje, že poznatky získané z testování pomocí GPT-Red byly využity ke zlepšení zabezpečení nejnovějšího modelu.
Podle informací MIT Technology Review byl GPT-Red při hledání slabin úspěšnější než lidští red-teameři, tedy odborníci, kteří se běžně věnují testování bezpečnosti systémů simulováním útoků. Model dokázal objevit zranitelnosti, které lidští testeři přehlédli, a to ve výrazně kratším čase.
GPT-Red má však i své limity. Není příliš efektivní u útoků, které vyžadují přímou interakci mezi útočníkem a cílem v reálném čase, a je slabší také v úlohách zahrnujících práci s obrázky. Tyto oblasti zůstávají doménou, kde si lidští testeři zatím drží náskok.
OpenAI podle dostupných informací neplánuje zpřístupnit GPT-Red veřejnosti ani jiným organizacím. Model zůstává interním nástrojem používaným výhradně k testování a zlepšování zabezpečení vlastních produktů. Vývoj byl podpořen finančními prostředky jedné z nejbohatších společností na světě, což naznačuje rozsah investic, které OpenAI do bezpečnostního výzkumu vkládá.
Projekt GPT-Red zapadá do širšího trendu, kdy technologické firmy vyvíjející velké jazykové modely čelí rostoucímu tlaku na zajištění bezpečnosti svých systémů. S tím, jak se modely stávají výkonnějšími a jsou nasazovány v citlivějších oblastech, roste i motivace útočníků hledat způsoby, jak jejich ochranné mechanismy obejít. Použití specializovaného modelu, který sám aktivně hledá slabiny dřív, než je najdou útočníci, představuje jeden z přístupů, jak tomuto tlaku čelit.
Případ GPT-Red zároveň ukazuje, jakým směrem se ubírá interní bezpečnostní práce velkých AI laboratoří – místo spoléhání se výhradně na lidské experty firmy stále více využívají samotné modely k testování a posilování vlastní odolnosti. Zda a jak rychle se podobné nástroje roz
Publikováno: 22. 07. 2026
Kategorie: Kyberbezpečnost | Novinky