Gemini dostał potężny zastrzyk inteligencji. Google zmienia sposób rozmowy z AI

Robert LewandowskiSkomentuj
Gemini dostał potężny zastrzyk inteligencji. Google zmienia sposób rozmowy z AI

Google pokazało dwie nowe wersje swojego modelu głosowego, które mają sprawić, że rozmowa ze sztuczną inteligencją będzie znacznie bardziej naturalna. Gemini 3.8 Live i Gemini 3.8 Live Extended Thinking potrafią nie tylko odpowiadać niemal w czasie rzeczywistym, ale również analizować obraz, wykonywać zadania w tle i prowadzić rozbudowane operacje bez przerywania rozmowy.



Gemini może rozmawiać i działać jednocześnie

Według Google Gemini 3.8 Live został zaprojektowany do obsługi rozmów głosowych w czasie zbliżonym do rzeczywistego. Firma podaje również, że model może przetwarzać obraz niemal w czasie rzeczywistym. Dzięki temu podczas rozmowy uwzględnia także informacje z obrazu przekazywanego przez użytkownika.

Google podaje, że Gemini 3.8 Live automatycznie wykrywa i przełącza się pomiędzy 97 obsługiwanymi językami nawet w trakcie jednej rozmowy. Model może też wykonywać wywołania narzędzi i API w tle, podczas gdy użytkownik nadal z nim rozmawia.



W praktyce oznacza to zmianę sposobu korzystania z głosowego asystenta. Zamiast czekać, aż AI zakończy jedno zadanie, można kontynuować rozmowę, podczas gdy model wykonuje kolejne operacje. Google pokazuje między innymi scenariusze związane z wdrażaniem nowych pracowników, analizowaniem obrazu z kamery czy grą w szachy obserwowaną przez smartfon.

Drugi model idzie krok dalej

Znacznie ciekawiej prezentuje się Gemini 3.8 Live Extended Thinking. Ta wersja została przygotowana z myślą o bardziej skomplikowanych zadaniach wymagających wieloetapowego rozumowania. Model ten potrafi jednocześnie rozumować i prowadzić rozmowę. Nie oznacza to więc konieczności czekania w ciszy na zakończenie dłuższego procesu. Gemini może potwierdzić, że zajmuje się zadaniem, a następnie przekazywać użytkownikowi informacje o postępie.

Google pokazuje na przykład przekształcanie narysowanego odręcznie projektu interfejsu w działający kod React na podstawie poleceń głosowych. W innym scenariuszu AI prowadzi rozmowę z klientem, a w tle zajmuje się wieloetapową rezerwacją stolika i wykonywaniem kolejnych wywołań funkcji. Według Google Gemini 3.8 Live Extended Thinking osiągnął 82,6 pkt w Speech to Speech Quality Index firmy Artificial Analysis. Model uzyskał również 68,6 proc. w teście τ-Voice dotyczącym wykonywania zadań przez agentów głosowych oraz 35,1 proc. w bankowym benchmarku τ-Voice firmy Sierra. W teście Big Bench Audio wynik wyniósł 97,7 proc.

Warto jednak zaznaczyć, że są to wyniki przedstawione przez Google na podstawie konkretnych benchmarków. Nie należy traktować ich jako uniwersalnego pomiaru jakości modelu we wszystkich zastosowaniach.

Nowe Gemini trafia również do usług Google

Zmiany nie dotyczą wyłącznie deweloperów. Google wykorzystuje nowe modele również w swoich usługach. Gemini 3.8 Live trafia do Search Live, a bardziej zaawansowana wersja Extended Thinking jest wdrażana między innymi w Gemini Live. Google pokazuje także integrację z Workspace. Nowe możliwości mają ułatwiać pracę w Dokumentach, Gmailu i Keep, pozwalając wykonywać bardziej złożone zadania za pomocą głosu.

Dla użytkowników ważna jest również funkcja wizualnego rozumienia kontekstu. Można skierować kamerę na problem techniczny, a Gemini może analizować to, co znajduje się przed obiektywem, i prowadzić użytkownika przez kolejne kroki rozwiązania problemu. Google rozwija przy tym również zaplecze dla firm i deweloperów. Gemini 3.8 Live oraz Gemini 3.8 Live Extended Thinking są dostępne przez Gemini API i Google AI Studio. Wersje przeznaczone dla przedsiębiorstw trafiają natomiast do prywatnych testów w Gemini Enterprise.

Google deklaruje, że nowe modele mają być podstawą dla kolejnej generacji agentów głosowych. Kluczowa zmiana polega na połączeniu rozmowy, rozumowania, analizy obrazu i wykonywania zadań w jednym procesie. AI nie musi już kończyć rozmowy, aby zacząć działać. Może rozmawiać z użytkownikiem, analizować dane i wykonywać kolejne operacje równocześnie.

Źródło tekstu i zdjęcia otwierającego: Google

Robert LewandowskiLubię wiedzieć, jak działa świat, ten duży i ten tuż za rogiem. Fascynują mnie ludzie, społeczeństwo, nowe technologie i polityka, a najbardziej to, jak wszystko się ze sobą łączy i wpływa na nasze codzienne życie.