Claude Sonnet 5 najgorszym modelem Anthropic w historii

Nowy model Anthropic – Claude Sonnet 5

Anthropic wypuścił nowy model o nazwie Claude Sonnet 5. To największa zmiana w serii Sonnet od lat. Firma obiecywała, że model będzie lepszy. Miał mieć mniej błędów i lepiej planować. Niestety, rzeczywistość jest zupełnie inna.

Przetestowaliśmy ten model w wielu zadaniach. Wyniki są bardzo słabe. Model nie działa tak, jak powinien. W niektórych testach jest nawet gorszy niż starsze wersje. To duże rozczarowanie dla wszystkich użytkowników.

Warto porównać go z wcześniejszymi modelami. Na przykład Claude Opus 4.8 działa dużo lepiej. Wiele firm, które używają AI w biznesie, czekało na ten model. Ale wygląda na to, że lepiej zostać przy starszych wersjach.

Benchmarki – dobre liczby, zła rzeczywistość

Na papierze Sonnet 5 wygląda przyzwoicie. Wyniki testów są całkiem dobre. Na przykład w testach kodowania agentowego model osiąga 63,2%. To lepiej niż Sonnet 4.6, który miał 58,1%. Ale Opus 4.8 ma 69,2%, więc różnica wciąż jest duża.

W innych testach też nie jest źle. W Terminal Bench 2.1 model ma 80,4%. To bardzo blisko wyniku Opus. W testach używania komputera model dostaje 81,2%. Ale liczby nie pokazują całej prawdy. W codziennym użyciu model działa dużo gorzej.

Rzeczywiste rankingi

Ważniejsze są prawdziwe testy z życia. Na przykład w Cursor Bench, który sprawdza modele do programowania, Sonnet 5 jest dopiero na 13. miejscu. To bardzo słaby wynik. Inne modele, jak Opus, są dużo wyżej.

Model ma być szybszy i tańszy od Opus. Ale w praktyce tak nie jest. Użytkownicy zgłaszają, że model działa wolno. Do tego wyniki są słabsze. To niszczy cały sens używania tego modelu.

Firma AI w Biznesie często testuje różne modele AI. Nasi eksperci zauważyli, że Sonnet 5 nie spełnia obietnic. W porównaniu z innymi modelami na rynku wypada słabo. To problem dla firm, które szukają wydajnych narzędzi.

Cena i tokeny – ukryty haczyk

Anthropic obniżył cenę za używanie modelu. Wstępna cena to 2 dolary za milion tokenów wejściowych. Tokeny to małe fragmenty tekstu, które model analizuje. Cena za tokeny wyjściowe to 10 dolarów za milion. Ta promocja trwa do sierpnia 2026 roku.

Potem cena wzrośnie. Będzie 3 dolary za tokeny wejściowe i 15 dolarów za wyjściowe. To jeszcze nie wszystko. W przypisach jest ważna informacja. Sonnet 5 używa nowego rodzaju tokenów – takich samych jak Opus 4.7.

Więcej tokenów, wyższe koszty

Nowe tokeny są inne. Ten sam tekst może mieć od 1,0 do 1,3 razy więcej tokenów niż wcześniej. To zależy od treści. Czyli cena może być niższa, ale koszty rosną. Niektóre zapytania są droższe, niż się wydaje.

Firma Anthropic zrobiła to celowo. Chcieli, żeby ceny wyglądały atrakcyjnie. Ale w praktyce nie ma oszczędności. Użytkownicy płacą tyle samo, co za Opus. Tylko dostają gorsze wyniki.

Porównajmy dokładnie. Sonnet 5 jest tylko 72 centy tańszy od Opus 4.8 Max. To bardzo mała różnica. Za te pieniądze lepiej zapłacić trochę więcej i dostać lepszy model. W firmie AI w Biznesie radzimy klientom, żeby dobrze liczyli koszty.

Testy praktyczne – model się nie sprawdza

Przeprowadziliśmy kilka testów w praktyce. Chcieliśmy zobaczyć, jak model radzi sobie z prawdziwymi zadaniami. Wyniki są bardzo różne, ale głównie słabe. Model traci dużo tokenów i nie daje dobrych rezultatów.

Klon systemu MacOS

Model wygenerował działający klon systemu MacOS. To było w narzędziu World of AI Benchmark. Zajęło to około 40 minut. Model zużył bardzo dużo tokenów w trybie maksymalnym. To nie było wydajne.

Niektóre funkcje działają. Jest pasek górny, zmiana wyglądu, tapety. Są też aplikacje jak Safari, Messenger, Kalendarz. Ale aplikacja Mapy jest o wiele gorsza niż w modelu Opus. Model nie jest efektywny – zużywa dużo, a daje mało.

Test Minecraft

Model próbował wygenerować grę podobną do Minecraft. Użył nowych tekstur, co jest ciekawe. Woda działa, są różne postacie. Można stawiać bloki. Ale brakuje animacji niszczenia bloków. Nie ma systemu ekwipunku ani nieskończonego terenu.

Ocena to tylko 6,5 na 10. Gra jest glitchowa i nie spełnia oczekiwań. Model nie poradził sobie z tym zadaniem. To pokazuje, że nie jest gotowy do tworzenia gier. Firma AI w Biznesie testuje modele do różnych zastosowań – ten wypada słabo.

Frontend strony internetowej

Model wygenerował stronę startową dla firmy SAS. Wygląda ładnie, ale nie działa. Funkcje takie jak przewijanie nie są aktywne. Brakuje też niektórych elementów. To pokazuje, że model nie radzi sobie z interaktywnymi stronami.

Porównaliśmy z modelem GLM 5.2. Tamta generacja jest lepsza. Sonnet 5 jest gorszy od konkurencji. To problem dla firm, które tworzą strony internetowe. Potrzebują modeli, które robią to dobrze.

Grafika SVG – najgorszy test

Testowaliśmy tworzenie grafiki SVG. Poprosiliśmy o samochód BMW M4 CS. Model nie potrafił zrobić poprawnego rysunku. Proporcje i kształt są złe. Samochód nie wygląda jak BMW. Nawet w trybie wysokiej jakości wynik jest słaby.

Opus 4.8 robi to o wiele lepiej. Ma poprawne proporcje i dobry kształt. Sonnet 5 jest w tej dziedzinie bardzo słaby. Nawet modele takie jak GLM 5.2 radzą sobie lepiej. To duże rozczarowanie dla osób zajmujących się grafiką.

Wydajność tokenów – najgorszy model w historii

Główną zaletą modeli Sonnet miała być wydajność. Miały być szybsze i tańsze od Opus. Ale Sonnet 5 jest zupełnie inny. To najmniej wydajny model, jaki Anthropic kiedykolwiek wypuścił. Zużywa mnóstwo tokenów.

W trybie maksymalnym model zużywa prawie tyle samo tokenów co Opus. A daje gorsze wyniki. To niszczy cały sens używania tego modelu. Użytkownicy tracą czas i pieniądze. W firmie AI w Biznesie zalecamy ostrożność przy wyborze modeli.

Możliwe, że Anthropic spieszył się z wydaniem. Może chcieli zareagować na zmiany w rządzie USA. Ale to nie tłumaczy tak słabej jakości. Model jest nieprzydatny do codziennej pracy. Lepiej poczekać na nowsze wersje.

Podsumowanie – nie warto używać tego modelu

Claude Sonnet 5 to porażka. Model nie jest krokiem naprzód. Jest gorszy od tego, co już mamy. Na przykład Opus 4.8 jest o wiele lepszy. Różnica w cenie jest mała, ale w jakości – ogromna.

Największym zaskoczeniem jest nowy system tokenów. Model zużywa więcej tokenów, a daje gorsze wyniki. To sprawia, że używanie go nie ma sensu. W kreatywnych zadaniach, jak SVG, model jest bardzo słaby.

Nasza rada: nie używajcie Sonnet 5. Zostańcie przy Opus 4.8. To da wam lepsze rezultaty. Model jest tańszy? Tylko pozornie. W praktyce koszty są podobne, a wyniki gorsze.

Anthropic może wypuścić lepszy model w przyszłości. Może to będzie Fable 5 lub Opus 5. Ale na razie Sonnet 5 to najgorszy model w historii firmy. W firmie AI w Biznesie testujemy wiele modeli – ten nie polecamy nikomu.

Jeśli szukacie narzędzi AI do pracy, wybierzcie sprawdzone opcje. Modele takie jak Opus 4.8 są godne zaufania. Dają lepsze wyniki i są bardziej wydajne. Sonnet 5 to strata czasu i pieniędzy.

#

No responses yet

Dodaj komentarz

Twój adres e-mail nie zostanie opublikowany. Wymagane pola są oznaczone *

Recent Comments

Brak komentarzy do wyświetlenia.
NEWSLETTER

3 narzędzia AI z zagranicy - po polsku

Co tydzień skanuję zachodnie newslettery i tłumaczę najlepsze perełki dla Ciebie.

Źródła: TLDR AI · The Neuron · AI Breakfast · Ben's Bites