Novinky | AI 06. 09. 2026

Google DeepMind spouští agentní analýzu videa v Gemini se snížením nákladů až o 66 procent

Google Deepmind Spouští Agentní Analýzu Videa V Gemini Se Snížením Nákladů Až O 66 Procent

Google DeepMind od 1. září 2026 zavádí do svých modelů Gemini novou funkci agentního video porozumění, která má zásadně změnit způsob, jakým vývojáři zpracovávají dlouhé videoobsahy. Novinka je dostupná prostřednictvím Google AI Studio a Gemini Enterprise Agent Platform a podporují ji modely Gemini 3.7 Flash, 3.6 Flash a 3.5 Flash-Lite.

Podle Rohana Doshiho, senior product manažera Google DeepMind, agentní přístup mění tradiční způsob analýzy videa. Namísto plošného zpracování celého záznamu model dynamicky skenuje pouze relevantní segmenty videa, což vede k výraznému snížení výpočetní zátěže. „Agentic video understanding transforms how developers can process long-form video content, uvedl Doshi.

Podle Maria Lučiće, ředitele výzkumu v Google DeepMind, přináší nová technologie měřitelné zlepšení jak v efektivitě, tak v přesnosti. Testy ukázaly snížení spotřeby tokenů až o 88 procent, což se promítá do snížení nákladů na analýzu videa až o 66 procent. Zároveň se podle benchmarků zlepšila i kvalita výsledků, a to až o 7 procent.

Klíčovou vlastností nové funkce je schopnost modelu inteligentně rozhodovat, které části videa vyžadují detailní analýzu a které lze přeskočit, aniž by tím utrpěla celková přesnost výstupu. Systém dokáže přesně detekovat anomálie v záznamu, počítat výskyt konkrétních akcí či objektů a rychle vyhledávat specifické momenty v rozsáhlém videomateriálu.

Mezi praktické případy použití patří rychlé vyhledávání konkrétních okamžiků v dlouhých záznamech, detekce neobvyklých událostí nebo sledování fyzických pohybů objektů či osob v čase. Tyto schopnosti mohou najít uplatnění napříč odvětvími, od bezpečnostního monitoringu přes analýzu sportovních záznamů až po kontrolu kvality ve výrobě.

Aktivace agentního video porozumění je pro vývojáře relativně jednoduchá – stačí v nastavení API přepnout příslušný parametr na hodnotu „agentic. Tato změna umožní modelům Gemini automaticky uplatňovat novou strategii zpracování videa bez nutnosti dalších úprav kódu.

Zavedení agentního video porozumění zapadá do širší strategie Google DeepMind zaměřené na zvyšování efektivity multimodálních modelů při zachování nebo zlepšení kvality výstupů. Snížení nákladů na zpracování videa až o dvě třetiny může být zásadní zejména pro firmy a vývojáře, kteří pracují s velkými objemy videoobsahu a dosud museli řešit vysoké provozní náklady spojené s jeho analýzou.

Nová funkce je již dostupná v produkčním prostředí prostřednictvím zmíněných platforem, což naznačuje, že Google počítá s jejím rychlým nasazením do reálných aplikací. Vzhledem k tomu, že podporu nabízejí hned tři modely řady Flash, lze očekávat široké využití napříč různými scénáři nasazení, od lehkých aplikací až po podnikové řešení s vysokými nároky na objem zpracovávaných dat.

Našli jste v článku chybu?

Publikováno: 06. 09. 2026

Kategorie: Novinky | AI