← wszystkie wpisy
2026.06.30 1 min

Leaderboard: wyniki na żywo i natywność polszczyzny

Macierz benchmarków × modele, wizualny raport natywności i strategia SFT/CPT. Jak mierzymy to, czego nie łapią benchmarki MCQ.

W poprzednich wpisach opisaliśmy inżynierskie wyzwania i porażki. Teraz pokażemy, jak mierzymy wyniki — nie tylko suche liczby, ale też jakość polszczyzny.

Natywność polszczyzny
Czy model pisze po polsku jak rodzimy użytkownik: fleksja, składnia, leksyka, frazeologia, literatura, realia, kalibracja, styl.

111 itemów, sędzia otwarty. Mierzy to, czego nie łapią benchmarki MCQ.

wizualny raport →
strategia SFT/CPT →
Dlaczego to ważne
Standardowe benchmarki (MMLU, GSM8K) mierzą rozumowanie, ale nie mierzą jakości języka. Model może mieć świetne wyniki na MCQ, ale pisać jak tłumacz Google z 2015 roku.

Natywność polszczyzny to kluczowa metryka dla użytkowników polskich — profesjonalistów, którzy potrzebują modelu, który:

Używa poprawnej gramatyki i fleksji
Rozumie polskie realia kulturowe
Pisze naturalnie, a nie „z angielska"
Jak mierzymy
Sędzia otwarty
Używamy mocnego modelu open-source (np. Qwen3.5-122B) do oceny odpowiedzi na skalę 1-5 w kilku kategoriach:

Gramatyka i fleksja
Składnia
Leksyka i frazeologia
Realia kulturowe
Styl i naturalność
111 itemów
Zbiór testowy obejmuje różnorodne zadania:

Emaile formalne i nieformalne
Opisy techniczne
Teksty kreatywne
Tłumaczenia kontekstowe
Dialogi
Wizualny raport
Wyniki są prezentowane jako interaktywne wykresy, które pokazują:

Rozkład ocen w każdej kategorii
Porównanie między modelami
Przykłady dobrych i złych odpowiedzi
Macierz: benchmarki × modele
Pełna macierz wyników pokazuje, jak każdy model wypada na każdym benchmarku:

Polski rdzeń (LLMzSzŁ, PES, PoQuAD, Belebele)
Kontrola regresji (MMLU, GSM8K, ARC-Challenge)
Natywność polszczyzny
Co widzimy
Base Qwen3.5-9B jest silny na większości benchmarków, ale słaby na natywności polszczyzny. Nasze fine-tunowanie poprawia język bez psucia rozumowania.

To jest równowaga, której szukamy: model, który zarówno rozumie, jak i dobrze mówi po polsku.

Nawigacja
Poprzedni: Engineering log: co poszło nie tak i czego się nauczyliśmy

Więcej: Pełny leaderboard · Raport natywności · GitHub