Struktura języka
Kompresja tekstu i podstawowe zależności sekwencyjne.
CodeSOTA field guide · base models · 2026
Poprawna drabinka benchmarków dla modeli od 1M do 7B parametrów. Każdy test wchodzi wtedy, gdy daje sygnał — po oderwaniu od losowości, ale przed nasyceniem.
Model nie pozostaje całkowicie losowy.
Wynik nie osiągnął jeszcze nasycenia.
Checkpointy różnią się bardziej niż błąd pomiaru.
Scoring nie wymaga instruction tuningu.
Kompresja tekstu i podstawowe zależności sekwencyjne.
Pierwszy zewnętrzny sygnał językowy; nadal bez KPI wiedzy.
Przejście od formy języka do wiedzy leksykalnej.
Najbardziej informacyjny zakres dla klasycznych małych base modeli.
Trudniejsze dystraktory przejmują rolę prostych testów wiedzy.
Szersza wiedza i common sense; MMLU raportowane kategoriami.
Matematyka i kod dopiero teraz stają się stabilną częścią zestawu.
Ogólne testy ustępują trudniejszym ewaluacjom domenowym.
Mierz osobno prozę, wiadomości, dialog, kod i dokumenty techniczne. BPB pozostaje główną miarą dla modeli 1–50M.
Obok accuracy raportuj średni margines oraz soft score σ(m). Mały model może poprawiać rozkład, zanim zmieni decyzję binarną.
Dla 50–150M używaj target-token NLL, MRR i top-k. Exact match awansuje do głównej metryki dopiero, gdy przestaje być prawie zerowy.
Raportuj też prawdopodobieństwo poprawnej odpowiedzi i margines do najlepszego dystraktora. HellaSwag bez normalizacji premiuje krótsze completion.
Wyniki rodziny Pythia dobrze pokazują nakładanie się testów. SciQ szybko daje mocny sygnał i zbliża się do sufitu; ARC-Challenge zaczyna późno i rośnie wolno. ARC-Easy oraz LAMBADA spinają środek skali.
| Model | SciQ | ARC-Easy | LAMBADA | ARC-Challenge |
|---|---|---|---|---|
| 70M | 60.1% | 37.4% | 18.5% | 18.1% |
| 160M | 74.1% | 43.5% | 32.8% | 18.8% |
| 410M | 81.1% | 52.1% | 51.6% | 21.3% |
| 1B | 84.0% | 56.9% | 56.2% | 24.4% |
| 2.8B | 88.2% | 64.4% | 64.7% | 29.5% |
| 6.9B | 89.7% | 67.3% | 67.3% | 31.3% |
Wartości referencyjne Pythia służą tu do pokazania zakresu dynamicznego, nie do tworzenia nowego rankingu modeli.
Accuracy jest blisko chance, ale soft score lub margines zaczyna reagować. Przykład: SciQ 28% przy chance 25% dla modelu byte-level 50M.
Wynik jest wyraźnie ponad chance, różnice przekraczają błąd pomiarowy, rezultat pozostaje poniżej 90–95%, a prompt nie dominuje wyniku.
Test pozostaje w raporcie, ale wypada z agregatu. Dotyczy to np. SciQ dla kilku miliardów parametrów albo nasyconych kategorii BLiMP.
IFEval, AlpacaEval, MT-Bench, format adherence i tool use wymagają instruction tuningu. Nie powinny obniżać oceny surowego checkpointu po pretrainingu.