W poprzednich wpisach opisaliśmy inżynierskie wyzwania i porażki. Teraz pokażemy, jak mierzymy wyniki — nie tylko suche liczby, ale też jakość polszczyzny.
Natywność polszczyzny
Czy model pisze po polsku jak rodzimy użytkownik: fleksja, składnia, leksyka, frazeologia, literatura, realia, kalibracja, styl.
111 itemów, sędzia otwarty. Mierzy to, czego nie łapią benchmarki MCQ.
wizualny raport →
strategia SFT/CPT →
Dlaczego to ważne
Standardowe benchmarki (MMLU, GSM8K) mierzą rozumowanie, ale nie mierzą jakości języka. Model może mieć świetne wyniki na MCQ, ale pisać jak tłumacz Google z 2015 roku.
Natywność polszczyzny to kluczowa metryka dla użytkowników polskich — profesjonalistów, którzy potrzebują modelu, który:
Używa poprawnej gramatyki i fleksji
Rozumie polskie realia kulturowe
Pisze naturalnie, a nie „z angielska"
Jak mierzymy
Sędzia otwarty
Używamy mocnego modelu open-source (np. Qwen3.5-122B) do oceny odpowiedzi na skalę 1-5 w kilku kategoriach:
Gramatyka i fleksja
Składnia
Leksyka i frazeologia
Realia kulturowe
Styl i naturalność
111 itemów
Zbiór testowy obejmuje różnorodne zadania:
Emaile formalne i nieformalne
Opisy techniczne
Teksty kreatywne
Tłumaczenia kontekstowe
Dialogi
Wizualny raport
Wyniki są prezentowane jako interaktywne wykresy, które pokazują:
Rozkład ocen w każdej kategorii
Porównanie między modelami
Przykłady dobrych i złych odpowiedzi
Macierz: benchmarki × modele
Pełna macierz wyników pokazuje, jak każdy model wypada na każdym benchmarku:
Polski rdzeń (LLMzSzŁ, PES, PoQuAD, Belebele)
Kontrola regresji (MMLU, GSM8K, ARC-Challenge)
Natywność polszczyzny
Co widzimy
Base Qwen3.5-9B jest silny na większości benchmarków, ale słaby na natywności polszczyzny. Nasze fine-tunowanie poprawia język bez psucia rozumowania.
To jest równowaga, której szukamy: model, który zarówno rozumie, jak i dobrze mówi po polsku.
Nawigacja
Poprzedni: Engineering log: co poszło nie tak i czego się nauczyliśmy
Więcej: Pełny leaderboard · Raport natywności · GitHub