Bílý dům spustil iniciativu Gold Eagle pro koordinaci reakce na zranitelnosti AI
26. 07. 2026
Google představil 26. března 2026 nový model umělé inteligence Gemini 3.1 Flash Live, který si klade za cíl výrazně zlepšit přirozenost a spolehlivost audio AI. Nový model přináší vylepšenou přesnost zpracování zvuku a nižší latenci, což má uživatelům zajistit plynulejší a přirozenější hlasové interakce.
Model dosahuje skóre 90,8 % na benchmarku ComplexFuncBench Audio a 36,1 % na Scale AI's Audio MultiChallenge, což podle Googlu představuje měřitelný posun vpřed v oblasti schopností hlasových AI systémů. Součástí vylepšení je také lepší porozumění tónu a akustickým nuancím řeči, díky čemuž by měl model lépe reagovat na emocionální zabarvení hlasu či specifické zvukové podmínky prostředí.
Google model zpřístupnil hned v několika variantách podle cílové skupiny uživatelů. Vývojáři mohou s modelem pracovat prostřednictvím Gemini Live API v Google AI Studio, kde mají k dispozici nástroje pro integraci do vlastních aplikací a služeb. Podniky zaměřené na zákaznickou zkušenost mohou využít verzi Gemini Enterprise, která je navržena pro nasazení v komerčním prostředí, například v zákaznických centrech nebo automatizovaných podpůrných systémech. Běžní uživatelé se s modelem setkají prostřednictvím funkcí Search Live a Gemini Live, které jsou součástí stávajících produktů Googlu.
Dostupnost modelu je globální – Google uvádí podporu ve více než 200 zemích, což z Gemini 3.1 Flash Live činí jeden z nejšířeji nasazených hlasových AI modelů na světě. Konkrétní seznam podporovaných jazyků ani regionální omezení však společnost v tuto chvíli blíže nespecifikovala.
Mezi prvními firmami, které na model reagovaly pozitivně, jsou Verizon, LiveKit a The Home Depot. Jejich zájem naznačuje, že model nachází uplatnění zejména v telekomunikacích, platformách pro real-time komunikaci a maloobchodním sektoru, kde je kvalita hlasové interakce klíčová pro spokojenost zákazníků. Přesné detaily o konkrétním nasazení těchto společností zatím zveřejněny nebyly.
Z hlediska bezpečnosti a transparentnosti Google oznámil, že všechny audio výstupy generované modelem jsou automaticky označeny vodotiskem SynthID. Tato technologie umožňuje detekovat obsah vytvořený umělou inteligencí, i když je zvuk dále zpracován nebo upraven. Jde o součást širší snahy technologických společností o zavedení standardů pro identifikaci AI generovaného obsahu, která nabývá na důležitosti zejména v kontextu rostoucích obav z dezinformací a zneužití syntetického hlasu.
Gemini 3.1 Flash Live navazuje na předchozí vývoj v rodině modelů Gemini a potvrzuje, že Google nadále intenzivně investuje do oblasti hlasových a multimodálních AI systémů. Nízká latence modelu je přitom klíčovým parametrem pro reálné nasazení – v hlasových aplikacích totiž i drobné zpoždění výrazně snižuje přirozenost konverzace a může vést k frustraci uživatelů. Google v tomto směru reaguje na rostoucí konkurenci v oblasti hlasové AI, kde aktivně působí i OpenAI, Microsoft či Amazon.
Nový model tak představuje další krok v postupném přechodu od textových AI asistentů k systémům schopným plnohodnotné hlasové komunikace v reálném čase. Zda se Googlu podaří prosadit Gemini 3.1 Flash Live jako průmyslový standard v oblasti audio AI, ukáže teprve jeho skutečné nasazení v praxi a reakc