Ten wpis otwiera serię techniczną. Zaczynamy od slayer — repozytorium, które jest sercem całego warsztatu.
slayer to protokół dla polskiej inteligencji. W jednym miejscu mieszczą się: harness ewaluacyjny, strona labu, wyniki porównań modeli i dokumentacja metodyki treningu. To tutaj można zweryfikować większość rzeczy, o których piszemy.
Aktualny wynik — Bielik-11B-v3 vs Qwen3.5-9B
Zaczęliśmy od pomiaru bazowego. Porównaliśmy dwa modele na tym samym sprzęcie (RTX 3090, 4-bit GGUF, ollama), deterministycznie, na wielu seedach.
Wynik: Qwen3.5-9B wygrywa z Bielik-11B-v3 na 8 na 9 ważnych osi. Bielik trzyma się tylko na jednej — LLMzSzŁ, czyli egzaminy państwowe i zawodowe po polsku. To dokładnie oś, która jest kluczowa dla naszego targetu urzędniczo-prawniczego.
Decyzja: bazą dla naszych prac będzie Qwen3.5-9B, ale celujemy w polską specjalizację. Nie zaczynamy od pustego treningu własnej bazy — zaczynamy od silnego modelu ogólnego i wzmacniamy go tam, gdzie polskie zadania są najtrudniejsze.
Zasada czystości (no benchmaxxing)
Jedna z najważniejszych zasad w repozytorium: benchmarki służą wyłącznie do pomiaru, nigdy do treningu. Zdolności modelu budujemy na niezależnych danych, a benchmark weryfikuje uogólnienie na held-out.
Mierzymy tylko publiczne, pobieralne, deterministyczne zbiory: LLMzSzŁ, PES, PoQuAD, Belebele, FLORES, regresja EN. Korpusy treningowe przechodzą dekontaminację względem zbiorów testowych.
Dzięki temu wynik, który publikujemy, oznacza to, co powinien oznaczać: model potrafi, a nie model widział odpowiedzi.
Strategia treningu — super tanio + epsilon
Bielik-11B-v3 powstał w pełnym, kosztownym pipeline:
Mistral 7B → Depth Up-Scaling → CPT ~1.1T tokenów → SFT ~20M instrukcji → DPO/DPO-P → GRPO/RLVR
Nasza teza brzmi inaczej: można osiągnąć podobny lub lepszy efekt na polskiej osi, pomijając najdroższy etap (CPT). Startujemy z Qwen3.5-9B (Apache 2.0), robimy tani QLoRA SFT i GRPO/RLVR z weryfikatorem MCQ, celując w LLMzSzŁ i prawo/administrację.
To jest różnica filozoficzna: nie próbujemy zbudować wszystkiego od zera. Próbujemy inteligentnie wykorzystać to, co już działa, i skupić się na polskiej specjalizacji.
Struktura i reprodukcja
Repozytorium jest podzielone na:
bench/ — harness ewaluacyjny (MCQ, PoQuAD + judge, FLORES, GSM8K)
results/ — wyniki, leaderboard.json, status.json
*.html + assets/ — modularna strona slayer.fabryka.ai
Wyniki i metodyka są otwarte (MIT). Instrukcja reprodukcji jest w README: wystarczy ollama, Python 3.10+ i jedna komenda, żeby uruchomić benchmark.
Współpraca
Szukamy ludzi i organizacji: korpusy prawno-urzędowe, ewaluacje, trening, infrastruktura, use case'y i fundatorzy compute. Próg wejścia jest niski — są zadania od początkujących.
Co dalej?
W kolejnym wpisie weźmiemy Probierz — nasz kamień probierczy dla modeli AI. Pokażemy, dlaczego większość publicznych benchmarków jest zepsuta i jak budujemy coś, czego nie da się ograć.