BEAM

Seedlight BEAM: jedno miejsce, z którego prowadzisz cały eCommerce, z agentami AI znającymi Twój biznes →

← Wszystkie artykuły
AI EngineeringSzymon Żynda11 min czytania

Claude Fable 5.1 i Mythos 5.1: specyfikacja, benchmarki i co to zmienia u nas

Anthropic wydał 1 września 2026 dwa modele. Pełna specyfikacja, wszystkie opublikowane benchmarki, porównanie z resztą rodziny Claude, nowy cennik i uczciwa odpowiedź na pytanie, co to zmienia w pracy Seedlight.

Anthropic wydał 1 września 2026 dwa modele: Claude Fable 5.1 dla wszystkich klientów i Claude Mythos 5.1 wyłącznie dla uczestników programu Project Glasswing. Poniżej pełna specyfikacja, wszystkie opublikowane wyniki, porównanie z resztą rodziny i cennik. Na końcu odpowiedź na pytanie, które interesuje nas najbardziej: czy to cokolwiek zmienia w tym, jak pracujemy.

Kluczowe wnioski

  • Fable 5.1 (claude-fable-5-1) jest dostępny dla wszystkich. Mythos 5.1 (claude-mythos-5-1) ma tę samą specyfikację i cenę, ale wyłącznie dla uczestników Project Glasswing.
  • Największy skok w benchmarkach to badania naukowe: 52,6 procent wobec 24,7 u poprzednika i 29,0 u Opusa 5. Kodowanie agentowe rośnie z 42,0 na 55,8 procent.
  • Ceny wejścia i wyjścia bez zmian, ale odczyt z pamięci podręcznej tanieje o 75 procent. Anthropic szacuje oszczędność na 25 procent przy typowych zadaniach i do 45 procent przy mocno agentowych.
  • Żadna z trzech zmian łamiących zgodność nie dotyczy naszych wdrożeń. Realne pytanie jest o koszt i jakość przy długich sesjach agentowych, a na nie odpowiada dopiero pomiar.

Dwa modele, jedna specyfikacja

Fable 5.1 zastępuje Fable 5, a Mythos 5.1 zastępuje Mythos 5. Oba nowe modele mają identyczne parametry i identyczny cennik. Różni je wyłącznie to, kto może ich użyć.

Claude Fable 5.1Claude Mythos 5.1
Identyfikator w APIclaude-fable-5-1claude-mythos-5-1
DostępnośćWszyscy klienciProject Glasswing, na zaproszenie
Okno kontekstu1 mln tokenów1 mln tokenów
Maksymalna odpowiedź128 tys. tokenów128 tys. tokenów
MyślenieAdaptacyjne, zawsze włączoneAdaptacyjne, zawsze włączone
Domyślny poziom wysiłkuhighhigh
Wejście i wyjścietekst i obrazy do tekstutekst i obrazy do tekstu
Granica wiedzyczerwiec 2026czerwiec 2026
Wycofanie nie wcześniej niż1 września 20271 września 2027

Za dokumentacją Anthropic, dostęp 2 września 2026.

Fable 5.1 działa na Claude API, Amazon Bedrock (jako anthropic.claude-fable-5-1), Google Cloud, Microsoft Foundry i Claude Platform on AWS. Oba modele wymagają 30-dniowej retencji danych i nie są dostępne w trybie zerowej retencji bez osobnej zgody Anthropic.

Benchmarki opublikowane przez Anthropic

Wszystkie liczby poniżej pochodzą z ogłoszenia producenta, więc czytaj je jak benchmarki producenta. Nie mamy własnych pomiarów tych modeli i nie udajemy, że mamy.

TestFable 5.1Fable 5Opus 5GPT-5.6 Sol
Badania naukowe (Terminal-Bench-Science 0.1)52,6%24,7%29,0%22,4%
Kodowanie agentowe (Terminal-Bench 4.0)55,8%42,0%52,3%37,3%
Kodowanie agentowe (CursorBench 3.2.0)73,4%70,5%70,0%67,2%
Praca biurowa (GDPval-AA v2)1853172318241711
Procesy biznesowe (AutomationBench)31,4%17,1%26,9%19,6%
Obsługa komputera (OSWorld 2.0, częściowe)77,9%72,9%75,4%brak danych
Obsługa komputera (OSWorld 2.0, ścisłe)41,7%36,1%39,6%brak danych
Rozumowanie (Humanity’s Last Exam, bez narzędzi)60,9%57,8%56,6%brak danych
Rozumowanie (z narzędziami)65,0%63,8%63,6%brak danych

Za ogłoszeniem Anthropic z 1 września 2026, dostęp 2 września 2026.

Największy skok jest w badaniach naukowych: ponad dwukrotnie względem poprzednika i o dwadzieścia cztery punkty nad Opusem 5. Drugi wyraźny to AutomationBench, czyli procesy biznesowe, gdzie wynik prawie się podwoił, choć wartość bezwzględna 31,4 procent pokazuje, jak daleko tym testom do wysycenia. Przyrosty w rozumowaniu są za to niewielkie, w granicach trzech punktów, a na CursorBench przewaga nad Opusem 5 wynosi 3,4 punktu przy dwukrotnie wyższej cenie. Rozkład tych wyników mówi więcej niż same maksima: model jest wyraźnie lepszy tam, gdzie zadanie trwa długo i wymaga wielu kroków, a niemal równy tam, gdzie liczy się pojedyncza dobra odpowiedź.

Jedna rzecz w tych danych wymaga odnotowania. Dokumentacja mówi, że Mythos 5.1 ma te same możliwości co Fable 5.1, ale w ogłoszeniu Mythos pojawia się osobno na jednym teście, Terminal-Bench 4.0, z wynikiem 60,9 procent wobec 55,8 u Fable. Anthropic tej różnicy nie tłumaczy, więc i my nie będziemy.

Jak wypada na tle reszty rodziny Claude

Fable 5.1 nie jest modelem domyślnym i sam Anthropic tak go nie ustawia. Zalecenie z dokumentacji: zacznij od Opusa 5, a wyżej sięgaj przy wymagającym rozumowaniu i długich zadaniach agentowych.

Fable 5.1Opus 5Sonnet 5Haiku 4.5
Cena za mln (wejście / wyjście)10 / 50 USD5 / 25 USD2 / 10 USD1 / 5 USD
Okno kontekstu1 mln1 mln1 mln200 tys.
Maksymalna odpowiedź128 tys.128 tys.128 tys.64 tys.
SzybkośćNajwolniejszyUmiarkowanaSzybkiNajszybszy
MyślenieAdaptacyjne, zawszeAdaptacyjneAdaptacyjneRozszerzone
Granica wiedzyczerwiec 2026maj 2026styczeń 2026luty 2025
Wycofanie nie wcześniej niż1 wrz 202724 lip 202730 cze 202715 paź 2026

Za przeglądem modeli w dokumentacji Anthropic, dostęp 2 września 2026.

Fable 5.1 kosztuje dwa razy tyle co Opus 5 przy tym samym oknie kontekstu i tym samym limicie odpowiedzi. Płacisz za jakość rozumowania i za świeższą granicę wiedzy, nie za pojemność. W praktyce oznacza to prosty rachunek: milion tokenów wejścia i sto tysięcy wyjścia kosztuje 15 dolarów na Opusie 5 i 30 na Fable 5.1. Przy jednym zadaniu to różnica bez znaczenia, przy tysiącu przebiegów miesięcznie to już pozycja w budżecie, którą ktoś zauważy. Świeższa granica wiedzy, czerwiec zamiast maja 2026, jest przy tym różnicą jednego miesiąca i rzadko bywa argumentem rozstrzygającym.

Wniosek praktyczny: przy typowym zadaniu eCommerce różnica między Opusem 5 a Fable 5.1 rzadko uzasadni podwojony rachunek. Ma sens tam, gdzie własne testy pokazują, że Opus przy wysokim wysiłku dalej nie daje rady.

Cennik i obiecane oszczędności

Ceny wejścia i wyjścia są takie same jak w Fable 5. Zmieniła się jedna pozycja.

PozycjaCena za mln tokenówZmiana wobec Fable 5
Wejście10 USDbez zmian
Wyjście50 USDbez zmian
Zapis do pamięci, 5 minut12,50 USDbez zmian
Zapis do pamięci, 1 godzina20 USDbez zmian
Odczyt z pamięci0,25 USDo 75 procent taniej
Wsad (Batch API)5 / 25 USDbez zmian, 50 procent taniej

Mnożnik dla odczytu wynosi teraz 0,025 ceny bazowej wejścia, podczas gdy pozostałe modele Claude mają 0,1. Anthropic szacuje, że w efekcie Fable 5.1 wyjdzie o około 25 procent taniej niż Fable 5 przy typowych zadaniach, a przy mocno agentowych nawet o 45 procent.

Te liczby dotyczą porównania z Fable 5, nie z Opusem 5. Względem Opusa dalej płacisz dwa razy więcej za wejście i wyjście.

Zmiany w API

Trzy rzeczy przestają działać, pięć dochodzi. Kolejność ma znaczenie tylko dla tych, którzy już wołają Fable 5.

  • Wymuszone narzędzia znikają: tool_choice typu any albo tool zwraca błąd 400. Zostaje auto i none. Powód: myślenie jest zawsze włączone, a wymuszone wywołanie by je pominęło.
  • Bloki myślenia są przypisane do modelu: Fable 5.1 czyta bloki starszych modeli, żaden starszy nie odczyta jego. Przy przełączaniu modeli w trakcie rozmowy bloki są po cichu usuwane i nierozliczane.
  • Edycja historii unieważnia myślenie: zmiana instrukcji systemowej, listy narzędzi albo wcześniejszej wiadomości kończy się błędem. Kontrola obowiązuje dla kont założonych 31 sierpnia 2026 albo później.

Dochodzą za to: zmiana poziomu wysiłku w trakcie rozmowy bez unieważniania pamięci podręcznej, wiadomości systemowe ważne tylko przez jedną turę, czytelne komunikaty postępu między wywołaniami narzędzi, tańszy odczyt z pamięci oraz oznaczanie pochodzenia treści. Trzy pierwsze są w wersji beta i wymagają własnych nagłówków.

Osobno warto odnotować znak wodny. Każdy tekst z tych modeli niesie statystyczny znak wodny Anthropic, a pliki graficzne i wideo niosą podpisane poświadczenia C2PA. Producent podaje, że znak nie dodaje tokenów ani ukrytych znaków i nie zmienia treści. Jak potraktują to wyszukiwarki, dziś nie wie nikt.

Siedem zachowań, które zmieniły się same

Ta lista jest w dokumentacji najciekawsza, bo dotyczy rzeczy działających bez żadnej zmiany w kodzie. Podmiana identyfikatora modelu przechodzi zielono, a wynik jest inny.

  • Mniej równoległych wywołań: jedno narzędzie na turę tam, gdzie Fable 5 wołał kilka naraz. Więcej tur i tokenów, jakość bez zmian.
  • Mniej komunikatów postępu: model rzadziej pisze, co robi, zwłaszcza przy wysokim wysiłku.
  • Rzadsze sięganie po dane: przy niskim wysiłku częściej odpowiada z pamięci zamiast wyszukiwać.
  • Gęstsza proza: dłuższe zdania, mniej akapitów.
  • Mniej formatowania: rzadsze pogrubienia, nagłówki i listy.
  • Nieoznaczone cytaty: przy streszczaniu częściej powtarza fragmenty źródła bez oznaczenia ich jako cytat.
  • Przepisywanie całych plików: zamiast punktowej poprawki przepisuje plik od nowa, co podnosi rachunek za wyjście.

Nauka: wyniki z Project Glasswing

Anthropic podaje trzy wyniki z zamkniętego programu badawczego. Nie da się ich niezależnie zweryfikować, więc traktujemy je jako deklarację producenta.

  • Projektowanie białek: powinowactwo wiązania dziesięciokrotnie wyższe niż najlepsze projekty w konkursach, przy skuteczności blisko 50 procent wobec typowych 10 do 15.
  • Mapowanie Wenus: szczegóły do 2 do 3 kilometrów zamiast 10 do 20, wysokości dokładniejsze o 25 procent.
  • Biologia obliczeniowa: przyspieszenie modeli do 2,5 raza i szacowana oszczędność kosztów GPU od 30 do 60 procent.

Co to zmienia w Seedlight

Tu przestajemy cytować producenta. Sprawdziliśmy, gdzie te trzy zmiany łamiące zgodność mogłyby nas dotknąć, i odpowiedź jest krótka: żadna z nich nie ma u nas zastosowania. Nie mamy niczego do migrowania i nie planujemy tego zmieniać z powodu premiery.

W sposobie, w jaki budujemy: być może

Drugie miejsce, gdzie te modele nas dotykają, to Claude Code, którym budujemy platformy na co dzień. Tam historię rozmowy pilnuje samo narzędzie, więc trzecia zmiana łamiąca zgodność jest obsłużona za nas.

Zostają dwie rzeczy warte obserwacji. Pierwsza to koszt: przy długich sesjach agentowych tańszy odczyt z pamięci podręcznej realnie zbija rachunek, bo agent czytający katalog w kółko odczytuje ten sam prefiks. Druga to jakość na długich zadaniach, czyli dokładnie ten obszar, w którym benchmarki pokazują największe przyrosty.

Przeciwwaga jest w tej samej dokumentacji i warto ją policzyć, zanim ktoś obwieści oszczędności. Odczyt z pamięci podręcznej stanieje o 75 procent, ale dotyczy pozycji, która kosztuje 0,25 dolara za milion. Częstsze przepisywanie całych plików zamiast punktowych poprawek podnosi za to rachunek za wyjście, czyli pozycję po 50 dolarów za milion, dwustukrotnie droższą. Wystarczy więc, że model przepisze trochę więcej, niż zaoszczędzi na czytaniu, i cała obniżka zniknie. Te dwa efekty działają w przeciwne strony i nie zamierzam twierdzić, że wiem, który wygra u nas, zanim tego nie zmierzę.

Uczciwa odpowiedź na pytanie „czy to coś zmienia": po stronie wdrożeń nic, w narzędziu do budowania prawdopodobnie tak, ale dopiero po pomiarze na własnych zadaniach.

Czego z tego nie robimy

Nie przenosimy niczego na Fable 5.1 z powodu premiery. Model kosztuje dwa razy tyle co Opus 5, a jego przewaga jest w obszarach, w których nasza praca nie leży: badaniach naukowych i bardzo długich zadaniach agentowych. Przy wdrożeniu platformy eCommerce ta różnica rzadko zwróci podwojony rachunek.

Jeżeli masz działającą automatyzację AI, ten sam rachunek warto zrobić u siebie, zanim podmienisz identyfikator modelu. Wzorzec cichej zmiany zachowania opisaliśmy w tekście o tym, dlaczego automatyzacje AI zawodzą po cichu, a sposób, w jaki układamy pracę agentów, w tekście o agentic engineeringu.

W Seedlight wybór modelu trzymamy w etapie AI Automation frameworku BEAM, razem z testami na danych klienta. Dzięki temu zmiana modelu jest zmianą jednej linii i przebiegiem testów. Nie zdejmuje to ryzyka zmian zachowania opisanych wyżej, tylko skraca czas, w którym się o nich dowiesz. Zakres opisaliśmy na stronie automatyzacji AI w commerce, a przy generowaniu treści w opisach produktów.

FAQ

Czym różni się Mythos 5.1 od Fable 5.1?

Specyfikacją i ceną niczym: to samo okno kontekstu, ten sam limit odpowiedzi, ten sam cennik. Różnica jest w dostępie, bo Mythos 5.1 jest wyłącznie dla uczestników Project Glasswing, na zaproszenie. Jedna różnica techniczna: Mythos nie sprawdza spójności prefiksu przy blokach myślenia. W ogłoszeniu Mythos ma też wyższy wynik na Terminal-Bench 4.0 (60,9 wobec 55,8 procent), czego producent nie wyjaśnia.

Czy Fable 5.1 jest lepszy od Opusa 5 do każdego zadania?

Nie i sam Anthropic tak go nie ustawia. Dokumentacja zaleca zaczynać od Opusa 5, a po Fable 5.1 sięgać przy wymagającym rozumowaniu i długich zadaniach agentowych. Fable kosztuje dwa razy tyle przy identycznym oknie kontekstu, a w benchmarkach rozumowania przewaga jest rzędu trzech punktów procentowych.

Ile realnie kosztuje ten model w porównaniu z poprzednikiem?

Wejście i wyjście kosztują tyle samo co w Fable 5, czyli 10 i 50 dolarów za milion tokenów. Odczyt z pamięci podręcznej spadł z 1,00 do 0,25 dolara. Anthropic szacuje na tej podstawie oszczędność około 25 procent przy typowych zadaniach i do 45 procent przy mocno agentowych, ale to porównanie z Fable 5, nie z tańszym Opusem 5.

Czy musimy coś zmienić w swojej integracji?

Tylko jeśli już wołasz Fable 5 i robisz jedną z trzech rzeczy: wymuszasz wywołanie narzędzia, przełączasz modele w trakcie rozmowy albo Twój kod sam składa historię i edytuje wcześniejsze tury. Jeśli korzystasz z Claude Code, aplikacji claude.ai albo Agent SDK, historia jest pilnowana za Ciebie.

Skąd pochodzą liczby w tym tekście?

Specyfikacja, cennik i lista zmian pochodzą z dokumentacji Anthropic, a benchmarki i wyniki naukowe z ogłoszenia producenta z 1 września 2026. Wszystko sprawdzone 2 września 2026. Własnych pomiarów tych modeli nie mamy i nie przedstawiamy cudzych jako swoich.

Dziennik

Szymon Żynda

Współzałożyciel Seedlight · platformy eCommerce, AI, SEO i GEO

Więcej od tego autora

Newsletter

Dziennik prosto na skrzynkę

Nowe wpisy i wnioski z realnych wdrożeń, co jakiś czas. Zero spamu, wypisujesz się jednym kliknięciem.