Claude Fable 5.1 i Mythos 5.1: specyfikacja, benchmarki i co to zmienia u nas
Anthropic wydał 1 września 2026 dwa modele. Pełna specyfikacja, wszystkie opublikowane benchmarki, porównanie z resztą rodziny Claude, nowy cennik i uczciwa odpowiedź na pytanie, co to zmienia w pracy Seedlight.
Anthropic wydał 1 września 2026 dwa modele: Claude Fable 5.1 dla wszystkich klientów i Claude Mythos 5.1 wyłącznie dla uczestników programu Project Glasswing. Poniżej pełna specyfikacja, wszystkie opublikowane wyniki, porównanie z resztą rodziny i cennik. Na końcu odpowiedź na pytanie, które interesuje nas najbardziej: czy to cokolwiek zmienia w tym, jak pracujemy.
Kluczowe wnioski
- Fable 5.1 (claude-fable-5-1) jest dostępny dla wszystkich. Mythos 5.1 (claude-mythos-5-1) ma tę samą specyfikację i cenę, ale wyłącznie dla uczestników Project Glasswing.
- Największy skok w benchmarkach to badania naukowe: 52,6 procent wobec 24,7 u poprzednika i 29,0 u Opusa 5. Kodowanie agentowe rośnie z 42,0 na 55,8 procent.
- Ceny wejścia i wyjścia bez zmian, ale odczyt z pamięci podręcznej tanieje o 75 procent. Anthropic szacuje oszczędność na 25 procent przy typowych zadaniach i do 45 procent przy mocno agentowych.
- Żadna z trzech zmian łamiących zgodność nie dotyczy naszych wdrożeń. Realne pytanie jest o koszt i jakość przy długich sesjach agentowych, a na nie odpowiada dopiero pomiar.
Dwa modele, jedna specyfikacja
Fable 5.1 zastępuje Fable 5, a Mythos 5.1 zastępuje Mythos 5. Oba nowe modele mają identyczne parametry i identyczny cennik. Różni je wyłącznie to, kto może ich użyć.
| Claude Fable 5.1 | Claude Mythos 5.1 | |
|---|---|---|
| Identyfikator w API | claude-fable-5-1 | claude-mythos-5-1 |
| Dostępność | Wszyscy klienci | Project Glasswing, na zaproszenie |
| Okno kontekstu | 1 mln tokenów | 1 mln tokenów |
| Maksymalna odpowiedź | 128 tys. tokenów | 128 tys. tokenów |
| Myślenie | Adaptacyjne, zawsze włączone | Adaptacyjne, zawsze włączone |
| Domyślny poziom wysiłku | high | high |
| Wejście i wyjście | tekst i obrazy do tekstu | tekst i obrazy do tekstu |
| Granica wiedzy | czerwiec 2026 | czerwiec 2026 |
| Wycofanie nie wcześniej niż | 1 września 2027 | 1 września 2027 |
Za dokumentacją Anthropic, dostęp 2 września 2026.
Fable 5.1 działa na Claude API, Amazon Bedrock (jako anthropic.claude-fable-5-1), Google Cloud, Microsoft Foundry i Claude Platform on AWS. Oba modele wymagają 30-dniowej retencji danych i nie są dostępne w trybie zerowej retencji bez osobnej zgody Anthropic.
Benchmarki opublikowane przez Anthropic
Wszystkie liczby poniżej pochodzą z ogłoszenia producenta, więc czytaj je jak benchmarki producenta. Nie mamy własnych pomiarów tych modeli i nie udajemy, że mamy.
| Test | Fable 5.1 | Fable 5 | Opus 5 | GPT-5.6 Sol |
|---|---|---|---|---|
| Badania naukowe (Terminal-Bench-Science 0.1) | 52,6% | 24,7% | 29,0% | 22,4% |
| Kodowanie agentowe (Terminal-Bench 4.0) | 55,8% | 42,0% | 52,3% | 37,3% |
| Kodowanie agentowe (CursorBench 3.2.0) | 73,4% | 70,5% | 70,0% | 67,2% |
| Praca biurowa (GDPval-AA v2) | 1853 | 1723 | 1824 | 1711 |
| Procesy biznesowe (AutomationBench) | 31,4% | 17,1% | 26,9% | 19,6% |
| Obsługa komputera (OSWorld 2.0, częściowe) | 77,9% | 72,9% | 75,4% | brak danych |
| Obsługa komputera (OSWorld 2.0, ścisłe) | 41,7% | 36,1% | 39,6% | brak danych |
| Rozumowanie (Humanity’s Last Exam, bez narzędzi) | 60,9% | 57,8% | 56,6% | brak danych |
| Rozumowanie (z narzędziami) | 65,0% | 63,8% | 63,6% | brak danych |
Za ogłoszeniem Anthropic z 1 września 2026, dostęp 2 września 2026.
Największy skok jest w badaniach naukowych: ponad dwukrotnie względem poprzednika i o dwadzieścia cztery punkty nad Opusem 5. Drugi wyraźny to AutomationBench, czyli procesy biznesowe, gdzie wynik prawie się podwoił, choć wartość bezwzględna 31,4 procent pokazuje, jak daleko tym testom do wysycenia. Przyrosty w rozumowaniu są za to niewielkie, w granicach trzech punktów, a na CursorBench przewaga nad Opusem 5 wynosi 3,4 punktu przy dwukrotnie wyższej cenie. Rozkład tych wyników mówi więcej niż same maksima: model jest wyraźnie lepszy tam, gdzie zadanie trwa długo i wymaga wielu kroków, a niemal równy tam, gdzie liczy się pojedyncza dobra odpowiedź.
Jedna rzecz w tych danych wymaga odnotowania. Dokumentacja mówi, że Mythos 5.1 ma te same możliwości co Fable 5.1, ale w ogłoszeniu Mythos pojawia się osobno na jednym teście, Terminal-Bench 4.0, z wynikiem 60,9 procent wobec 55,8 u Fable. Anthropic tej różnicy nie tłumaczy, więc i my nie będziemy.
Jak wypada na tle reszty rodziny Claude
Fable 5.1 nie jest modelem domyślnym i sam Anthropic tak go nie ustawia. Zalecenie z dokumentacji: zacznij od Opusa 5, a wyżej sięgaj przy wymagającym rozumowaniu i długich zadaniach agentowych.
| Fable 5.1 | Opus 5 | Sonnet 5 | Haiku 4.5 | |
|---|---|---|---|---|
| Cena za mln (wejście / wyjście) | 10 / 50 USD | 5 / 25 USD | 2 / 10 USD | 1 / 5 USD |
| Okno kontekstu | 1 mln | 1 mln | 1 mln | 200 tys. |
| Maksymalna odpowiedź | 128 tys. | 128 tys. | 128 tys. | 64 tys. |
| Szybkość | Najwolniejszy | Umiarkowana | Szybki | Najszybszy |
| Myślenie | Adaptacyjne, zawsze | Adaptacyjne | Adaptacyjne | Rozszerzone |
| Granica wiedzy | czerwiec 2026 | maj 2026 | styczeń 2026 | luty 2025 |
| Wycofanie nie wcześniej niż | 1 wrz 2027 | 24 lip 2027 | 30 cze 2027 | 15 paź 2026 |
Za przeglądem modeli w dokumentacji Anthropic, dostęp 2 września 2026.
Fable 5.1 kosztuje dwa razy tyle co Opus 5 przy tym samym oknie kontekstu i tym samym limicie odpowiedzi. Płacisz za jakość rozumowania i za świeższą granicę wiedzy, nie za pojemność. W praktyce oznacza to prosty rachunek: milion tokenów wejścia i sto tysięcy wyjścia kosztuje 15 dolarów na Opusie 5 i 30 na Fable 5.1. Przy jednym zadaniu to różnica bez znaczenia, przy tysiącu przebiegów miesięcznie to już pozycja w budżecie, którą ktoś zauważy. Świeższa granica wiedzy, czerwiec zamiast maja 2026, jest przy tym różnicą jednego miesiąca i rzadko bywa argumentem rozstrzygającym.
Wniosek praktyczny: przy typowym zadaniu eCommerce różnica między Opusem 5 a Fable 5.1 rzadko uzasadni podwojony rachunek. Ma sens tam, gdzie własne testy pokazują, że Opus przy wysokim wysiłku dalej nie daje rady.
Cennik i obiecane oszczędności
Ceny wejścia i wyjścia są takie same jak w Fable 5. Zmieniła się jedna pozycja.
| Pozycja | Cena za mln tokenów | Zmiana wobec Fable 5 |
|---|---|---|
| Wejście | 10 USD | bez zmian |
| Wyjście | 50 USD | bez zmian |
| Zapis do pamięci, 5 minut | 12,50 USD | bez zmian |
| Zapis do pamięci, 1 godzina | 20 USD | bez zmian |
| Odczyt z pamięci | 0,25 USD | o 75 procent taniej |
| Wsad (Batch API) | 5 / 25 USD | bez zmian, 50 procent taniej |
Mnożnik dla odczytu wynosi teraz 0,025 ceny bazowej wejścia, podczas gdy pozostałe modele Claude mają 0,1. Anthropic szacuje, że w efekcie Fable 5.1 wyjdzie o około 25 procent taniej niż Fable 5 przy typowych zadaniach, a przy mocno agentowych nawet o 45 procent.
Te liczby dotyczą porównania z Fable 5, nie z Opusem 5. Względem Opusa dalej płacisz dwa razy więcej za wejście i wyjście.
Zmiany w API
Trzy rzeczy przestają działać, pięć dochodzi. Kolejność ma znaczenie tylko dla tych, którzy już wołają Fable 5.
- Wymuszone narzędzia znikają: tool_choice typu any albo tool zwraca błąd 400. Zostaje auto i none. Powód: myślenie jest zawsze włączone, a wymuszone wywołanie by je pominęło.
- Bloki myślenia są przypisane do modelu: Fable 5.1 czyta bloki starszych modeli, żaden starszy nie odczyta jego. Przy przełączaniu modeli w trakcie rozmowy bloki są po cichu usuwane i nierozliczane.
- Edycja historii unieważnia myślenie: zmiana instrukcji systemowej, listy narzędzi albo wcześniejszej wiadomości kończy się błędem. Kontrola obowiązuje dla kont założonych 31 sierpnia 2026 albo później.
Dochodzą za to: zmiana poziomu wysiłku w trakcie rozmowy bez unieważniania pamięci podręcznej, wiadomości systemowe ważne tylko przez jedną turę, czytelne komunikaty postępu między wywołaniami narzędzi, tańszy odczyt z pamięci oraz oznaczanie pochodzenia treści. Trzy pierwsze są w wersji beta i wymagają własnych nagłówków.
Osobno warto odnotować znak wodny. Każdy tekst z tych modeli niesie statystyczny znak wodny Anthropic, a pliki graficzne i wideo niosą podpisane poświadczenia C2PA. Producent podaje, że znak nie dodaje tokenów ani ukrytych znaków i nie zmienia treści. Jak potraktują to wyszukiwarki, dziś nie wie nikt.
Siedem zachowań, które zmieniły się same
Ta lista jest w dokumentacji najciekawsza, bo dotyczy rzeczy działających bez żadnej zmiany w kodzie. Podmiana identyfikatora modelu przechodzi zielono, a wynik jest inny.
- Mniej równoległych wywołań: jedno narzędzie na turę tam, gdzie Fable 5 wołał kilka naraz. Więcej tur i tokenów, jakość bez zmian.
- Mniej komunikatów postępu: model rzadziej pisze, co robi, zwłaszcza przy wysokim wysiłku.
- Rzadsze sięganie po dane: przy niskim wysiłku częściej odpowiada z pamięci zamiast wyszukiwać.
- Gęstsza proza: dłuższe zdania, mniej akapitów.
- Mniej formatowania: rzadsze pogrubienia, nagłówki i listy.
- Nieoznaczone cytaty: przy streszczaniu częściej powtarza fragmenty źródła bez oznaczenia ich jako cytat.
- Przepisywanie całych plików: zamiast punktowej poprawki przepisuje plik od nowa, co podnosi rachunek za wyjście.
Nauka: wyniki z Project Glasswing
Anthropic podaje trzy wyniki z zamkniętego programu badawczego. Nie da się ich niezależnie zweryfikować, więc traktujemy je jako deklarację producenta.
- Projektowanie białek: powinowactwo wiązania dziesięciokrotnie wyższe niż najlepsze projekty w konkursach, przy skuteczności blisko 50 procent wobec typowych 10 do 15.
- Mapowanie Wenus: szczegóły do 2 do 3 kilometrów zamiast 10 do 20, wysokości dokładniejsze o 25 procent.
- Biologia obliczeniowa: przyspieszenie modeli do 2,5 raza i szacowana oszczędność kosztów GPU od 30 do 60 procent.
Co to zmienia w Seedlight
Tu przestajemy cytować producenta. Sprawdziliśmy, gdzie te trzy zmiany łamiące zgodność mogłyby nas dotknąć, i odpowiedź jest krótka: żadna z nich nie ma u nas zastosowania. Nie mamy niczego do migrowania i nie planujemy tego zmieniać z powodu premiery.
W sposobie, w jaki budujemy: być może
Drugie miejsce, gdzie te modele nas dotykają, to Claude Code, którym budujemy platformy na co dzień. Tam historię rozmowy pilnuje samo narzędzie, więc trzecia zmiana łamiąca zgodność jest obsłużona za nas.
Zostają dwie rzeczy warte obserwacji. Pierwsza to koszt: przy długich sesjach agentowych tańszy odczyt z pamięci podręcznej realnie zbija rachunek, bo agent czytający katalog w kółko odczytuje ten sam prefiks. Druga to jakość na długich zadaniach, czyli dokładnie ten obszar, w którym benchmarki pokazują największe przyrosty.
Przeciwwaga jest w tej samej dokumentacji i warto ją policzyć, zanim ktoś obwieści oszczędności. Odczyt z pamięci podręcznej stanieje o 75 procent, ale dotyczy pozycji, która kosztuje 0,25 dolara za milion. Częstsze przepisywanie całych plików zamiast punktowych poprawek podnosi za to rachunek za wyjście, czyli pozycję po 50 dolarów za milion, dwustukrotnie droższą. Wystarczy więc, że model przepisze trochę więcej, niż zaoszczędzi na czytaniu, i cała obniżka zniknie. Te dwa efekty działają w przeciwne strony i nie zamierzam twierdzić, że wiem, który wygra u nas, zanim tego nie zmierzę.
Uczciwa odpowiedź na pytanie „czy to coś zmienia": po stronie wdrożeń nic, w narzędziu do budowania prawdopodobnie tak, ale dopiero po pomiarze na własnych zadaniach.
Czego z tego nie robimy
Nie przenosimy niczego na Fable 5.1 z powodu premiery. Model kosztuje dwa razy tyle co Opus 5, a jego przewaga jest w obszarach, w których nasza praca nie leży: badaniach naukowych i bardzo długich zadaniach agentowych. Przy wdrożeniu platformy eCommerce ta różnica rzadko zwróci podwojony rachunek.
Jeżeli masz działającą automatyzację AI, ten sam rachunek warto zrobić u siebie, zanim podmienisz identyfikator modelu. Wzorzec cichej zmiany zachowania opisaliśmy w tekście o tym, dlaczego automatyzacje AI zawodzą po cichu, a sposób, w jaki układamy pracę agentów, w tekście o agentic engineeringu.
W Seedlight wybór modelu trzymamy w etapie AI Automation frameworku BEAM, razem z testami na danych klienta. Dzięki temu zmiana modelu jest zmianą jednej linii i przebiegiem testów. Nie zdejmuje to ryzyka zmian zachowania opisanych wyżej, tylko skraca czas, w którym się o nich dowiesz. Zakres opisaliśmy na stronie automatyzacji AI w commerce, a przy generowaniu treści w opisach produktów.
FAQ
Czym różni się Mythos 5.1 od Fable 5.1?
Specyfikacją i ceną niczym: to samo okno kontekstu, ten sam limit odpowiedzi, ten sam cennik. Różnica jest w dostępie, bo Mythos 5.1 jest wyłącznie dla uczestników Project Glasswing, na zaproszenie. Jedna różnica techniczna: Mythos nie sprawdza spójności prefiksu przy blokach myślenia. W ogłoszeniu Mythos ma też wyższy wynik na Terminal-Bench 4.0 (60,9 wobec 55,8 procent), czego producent nie wyjaśnia.
Czy Fable 5.1 jest lepszy od Opusa 5 do każdego zadania?
Nie i sam Anthropic tak go nie ustawia. Dokumentacja zaleca zaczynać od Opusa 5, a po Fable 5.1 sięgać przy wymagającym rozumowaniu i długich zadaniach agentowych. Fable kosztuje dwa razy tyle przy identycznym oknie kontekstu, a w benchmarkach rozumowania przewaga jest rzędu trzech punktów procentowych.
Ile realnie kosztuje ten model w porównaniu z poprzednikiem?
Wejście i wyjście kosztują tyle samo co w Fable 5, czyli 10 i 50 dolarów za milion tokenów. Odczyt z pamięci podręcznej spadł z 1,00 do 0,25 dolara. Anthropic szacuje na tej podstawie oszczędność około 25 procent przy typowych zadaniach i do 45 procent przy mocno agentowych, ale to porównanie z Fable 5, nie z tańszym Opusem 5.
Czy musimy coś zmienić w swojej integracji?
Tylko jeśli już wołasz Fable 5 i robisz jedną z trzech rzeczy: wymuszasz wywołanie narzędzia, przełączasz modele w trakcie rozmowy albo Twój kod sam składa historię i edytuje wcześniejsze tury. Jeśli korzystasz z Claude Code, aplikacji claude.ai albo Agent SDK, historia jest pilnowana za Ciebie.
Skąd pochodzą liczby w tym tekście?
Specyfikacja, cennik i lista zmian pochodzą z dokumentacji Anthropic, a benchmarki i wyniki naukowe z ogłoszenia producenta z 1 września 2026. Wszystko sprawdzone 2 września 2026. Własnych pomiarów tych modeli nie mamy i nie przedstawiamy cudzych jako swoich.
Dziennik
Współzałożyciel Seedlight · platformy eCommerce, AI, SEO i GEO
Newsletter
Dziennik prosto na skrzynkę
Nowe wpisy i wnioski z realnych wdrożeń, co jakiś czas. Zero spamu, wypisujesz się jednym kliknięciem.