Rynek sztucznej inteligencji powiększył się o model Claude Sonnet 5.5. Według twórców, nowość od Anthropic generuje odpowiedzi ponad 30% szybciej niż poprzednik. Ponadto znacząco obniża koszty wykonania pojedynczych zadań. Ma posłużyć natomiast do codziennego programowania, automatyzacji kodu i analizy dokumentów, bez problemu przetwarza też pliki graficzne.
Co potrafi Sonnet 5.5? Zdumiewający skok w kodowaniu i analizie obrazu
Czy jednak faktycznie jest tak dobrze? Postęp widać przede wszystkim w testach programistycznych i zadaniach wymagających samodzielnego myślenia. Popularny test Terminal-Bench sprawdzający wydajność sztucznej inteligencji zakończył się wynikiem 70 procent (poprzednia wersja zgarnęła tylko 10 procent). Algorytm potrafi zatem sprawnie pisać kod, wyłapywać błędy i zarządzać całą architekturą oprogramowania przy minimalnej kontroli ze strony człowieka.
Model zyskał również dużą spostrzegawczość w analizie materiałów wizualnych. Podczas wewnętrznych prób inżynierowie zmusili algorytm do przejścia klasycznej gry Pokémon Red. Sztuczna inteligencja podejmowała wszystkie decyzje wyłącznie na podstawie ciągłego podglądu zrzutów ekranu i ukończyła rozgrywkę bez pomocy ludzi. Algorytm równie gładko poradził sobie ze skomplikowanymi wykresami finansowymi czy projektowaniem interfejsów aplikacji.
Mniej zbędnych kroków i sprawniejsza praca. AI przestaje zadawać pytania
Cena za pojedyncze zapytanie nie uległa zmianie, ale w praktyce rachunki spadną nawet o jedną trzecią. Nowy model wykonuje bowiem złożone polecenia w znacznie mniejszej liczbie kroków. Algorytm nie przeskakuje już niepotrzebnie po stronach internetowych i nie zadaje zbędnych pytań. Programiści testujący to rozwiązanie przyznają, że tworzenie aplikacji przebiega teraz błyskawicznie i bez irytujących przestojów.
Wyraźny skok możliwości skłonił inżynierów do wdrożenia zaawansowanych cyfrowych zabezpieczeń. To pierwszy model z tej serii, który otrzymał dedykowane filtry chroniące przed cyberatakami. Gdy system wykryje zapytanie o wysokim stopniu ryzyka, po cichu przekieruje je do bezpieczniejszego środowiska.
Trzeba oczywiście pamiętać, że większość przedstawionych wyników pochodzi z testów i demonstracji przygotowanych przez samego producenta. Nie oznacza to, że są one niewiarygodne, ale ich wyniki warto zweryfikować w niezależnych benchmarkach. Dopiero takie testy pokażą, jak Sonnet 5.5 wypada w porównaniu z konkurencyjnymi modelami i czy deklarowany wzrost możliwości rzeczywiście przekłada się na lepszą pracę poza kontrolowanymi scenariuszami.
Źródło tekstu: Anthropic / Zdjęcie otwierające: unsplash (@solenfeyissa)