LLM/metodologia ewaluacji

CodeSOTA field guide · base models · 2026

Nie pytaj małego modelu
o zbyt wielkie rzeczy.

Poprawna drabinka benchmarków dla modeli od 1M do 7B parametrów. Każdy test wchodzi wtedy, gdy daje sygnał — po oderwaniu od losowości, ale przed nasyceniem.

01powyżej chance

Model nie pozostaje całkowicie losowy.

02poniżej sufitu

Wynik nie osiągnął jeszcze nasycenia.

03mierzalny ruch

Checkpointy różnią się bardziej niż błąd pomiaru.

04base-model first

Scoring nie wymaga instruction tuningu.

01 / mapa

Jedna rodzina modeli.
Zmieniający się instrument pomiaru.

główny — wchodzi do KPIwyprzedzający — szuka pierwszego sygnału
01
1–10Mparametrów

Struktura języka

Kompresja tekstu i podstawowe zależności sekwencyjne.

GŁÓWNE
validation BPBtesty syntetyczne
WYPRZEDZAJĄCE
BLiMP
02
10–50Mparametrów

Składnia lokalna

Pierwszy zewnętrzny sygnał językowy; nadal bez KPI wiedzy.

GŁÓWNE
BPBBLiMPSyntaxGym
WYPRZEDZAJĄCE
SciQLAMBADA NLL
03
50–150Mparametrów

Prosta semantyka

Przejście od formy języka do wiedzy leksykalnej.

GŁÓWNE
BLiMPSciQ soft scoreLAMBADA NLL
WYPRZEDZAJĄCE
ARC-EasyPIQA
04
150–500Mparametrów

Wiedza i common sense

Najbardziej informacyjny zakres dla klasycznych małych base modeli.

GŁÓWNE
SciQARC-EasyLAMBADAPIQA
WYPRZEDZAJĄCE
HellaSwagOpenBookQA
05
500M–1Bparametrów

Trudne completion

Trudniejsze dystraktory przejmują rolę prostych testów wiedzy.

GŁÓWNE
ARC-EasyLAMBADAPIQAHellaSwag
WYPRZEDZAJĄCE
WinoGrandeARC-Challenge
06
1–3Bparametrów

Multiple choice

Szersza wiedza i common sense; MMLU raportowane kategoriami.

GŁÓWNE
HellaSwagWinoGrandeARC-ChallengeOpenBookQA
WYPRZEDZAJĄCE
MMLUGSM8K
07
3–7Bparametrów

Wiedza i reasoning

Matematyka i kod dopiero teraz stają się stabilną częścią zestawu.

GŁÓWNE
MMLUARC-ChallengeHellaSwagGSM8K
WYPRZEDZAJĄCE
BBHHumanEval
08
7B+parametrów

Frontier

Ogólne testy ustępują trudniejszym ewaluacjom domenowym.

GŁÓWNE
MMLUGSM8KBBHHumanEval
WYPRZEDZAJĄCE
benchmarki specjalistyczne
02 / sygnał przed accuracy

Najpierw margines.
Dopiero potem trafienie.

BPB

Porównuj tokenizery uczciwie.

BPB = NLL / (Nbytes · ln 2)

Mierz osobno prozę, wiadomości, dialog, kod i dokumenty techniczne. BPB pozostaje główną miarą dla modeli 1–50M.

BLiMP

Mierz kierunek i pewność.

m = log P(xgood) − log P(xbad)

Obok accuracy raportuj średni margines oraz soft score σ(m). Mały model może poprawiać rozkład, zanim zmieni decyzję binarną.

LAMBADA

Nie czekaj na exact match.

Ltarget = −log P(wtarget | context)

Dla 50–150M używaj target-token NLL, MRR i top-k. Exact match awansuje do głównej metryki dopiero, gdy przestaje być prawie zerowy.

MULTIPLE CHOICE

Normalizuj długość odpowiedzi.

score(a) = log P(a | q) / |a|

Raportuj też prawdopodobieństwo poprawnej odpowiedzi i margines do najlepszego dystraktora. HellaSwag bez normalizacji premiuje krótsze completion.

03 / zakres dynamiczny

Łatwy benchmark startuje wcześniej.
Trudny zostaje dłużej.

Wyniki rodziny Pythia dobrze pokazują nakładanie się testów. SciQ szybko daje mocny sygnał i zbliża się do sufitu; ARC-Challenge zaczyna późno i rośnie wolno. ARC-Easy oraz LAMBADA spinają środek skali.

ModelSciQARC-EasyLAMBADAARC-Challenge
70M60.1%37.4%18.5%18.1%
160M74.1%43.5%32.8%18.8%
410M81.1%52.1%51.6%21.3%
1B84.0%56.9%56.2%24.4%
2.8B88.2%64.4%64.7%29.5%
6.9B89.7%67.3%67.3%31.3%

Wartości referencyjne Pythia służą tu do pokazania zakresu dynamicznego, nie do tworzenia nowego rankingu modeli.

04 / cykl życia

Kiedy benchmark
awansuje w drabince?

01WYPRZEDZAJĄCY

Szuka początku kompetencji.

Accuracy jest blisko chance, ale soft score lub margines zaczyna reagować. Przykład: SciQ 28% przy chance 25% dla modelu byte-level 50M.

02GŁÓWNY

Rozróżnia modele i checkpointy.

Wynik jest wyraźnie ponad chance, różnice przekraczają błąd pomiarowy, rezultat pozostaje poniżej 90–95%, a prompt nie dominuje wyniku.

03KONTROLNY

Zachowuje ciągłość.

Test pozostaje w raporcie, ale wypada z agregatu. Dotyczy to np. SciQ dla kilku miliardów parametrów albo nasyconych kategorii BLiMP.

05 / protokół

Minimalny zestaw,
pełna historia skali.

  1. 01validation bits-per-byte
  2. 02BLiMP
  3. 03SciQ
  4. 04ARC-Easy
  5. 05LAMBADA
  6. 06PIQA
  7. 07HellaSwag
  8. 08WinoGrande
  9. 09ARC-Challenge
  10. 10MMLU
  11. 11GSM8K
  12. 12HumanEval — tylko dla modeli z kodem

Stałe zasady raportowania

  • Nie mieszaj wyników base i instruction-tuned.
  • MMLU rozbijaj na dziedziny; nie zaczynaj od jednej średniej.
  • GSM8K dla base modelu oznaczaj jako zależny od promptu i danych matematycznych.
  • HumanEval i MBPP licz tylko modelom trenowanym na kodzie.
  • Dla binarnych PIQA i WinoGrande raportuj przedziały ufności.
  • Zachowuj co najmniej dwa wspólne benchmarki między sąsiednimi skalami.
Poza zakresem base modelu

IFEval, AlpacaEval, MT-Bench, format adherence i tool use wymagają instruction tuningu. Nie powinny obniżać oceny surowego checkpointu po pretrainingu.