← wszystkie wpisy
2026.06.26 2 min

slayer: protokół dla polskiej inteligencji

Co robimy w głównym repozytorium Slayer AI Lab: benchmarki, porównanie Bielik vs Qwen, zasada czystości i tańsza ścieżka treningu.

Ten wpis otwiera serię techniczną. Zaczynamy od slayer — repozytorium, które jest sercem całego warsztatu.

slayer to protokół dla polskiej inteligencji. W jednym miejscu mieszczą się: harness ewaluacyjny, strona labu, wyniki porównań modeli i dokumentacja metodyki treningu. To tutaj można zweryfikować większość rzeczy, o których piszemy.

Aktualny wynik — Bielik-11B-v3 vs Qwen3.5-9B
Zaczęliśmy od pomiaru bazowego. Porównaliśmy dwa modele na tym samym sprzęcie (RTX 3090, 4-bit GGUF, ollama), deterministycznie, na wielu seedach.

Wynik: Qwen3.5-9B wygrywa z Bielik-11B-v3 na 8 na 9 ważnych osi. Bielik trzyma się tylko na jednej — LLMzSzŁ, czyli egzaminy państwowe i zawodowe po polsku. To dokładnie oś, która jest kluczowa dla naszego targetu urzędniczo-prawniczego.

Decyzja: bazą dla naszych prac będzie Qwen3.5-9B, ale celujemy w polską specjalizację. Nie zaczynamy od pustego treningu własnej bazy — zaczynamy od silnego modelu ogólnego i wzmacniamy go tam, gdzie polskie zadania są najtrudniejsze.

Zasada czystości (no benchmaxxing)
Jedna z najważniejszych zasad w repozytorium: benchmarki służą wyłącznie do pomiaru, nigdy do treningu. Zdolności modelu budujemy na niezależnych danych, a benchmark weryfikuje uogólnienie na held-out.

Mierzymy tylko publiczne, pobieralne, deterministyczne zbiory: LLMzSzŁ, PES, PoQuAD, Belebele, FLORES, regresja EN. Korpusy treningowe przechodzą dekontaminację względem zbiorów testowych.

Dzięki temu wynik, który publikujemy, oznacza to, co powinien oznaczać: model potrafi, a nie model widział odpowiedzi.

Strategia treningu — super tanio + epsilon
Bielik-11B-v3 powstał w pełnym, kosztownym pipeline:

Mistral 7B → Depth Up-Scaling → CPT ~1.1T tokenów → SFT ~20M instrukcji → DPO/DPO-P → GRPO/RLVR
Nasza teza brzmi inaczej: można osiągnąć podobny lub lepszy efekt na polskiej osi, pomijając najdroższy etap (CPT). Startujemy z Qwen3.5-9B (Apache 2.0), robimy tani QLoRA SFT i GRPO/RLVR z weryfikatorem MCQ, celując w LLMzSzŁ i prawo/administrację.

To jest różnica filozoficzna: nie próbujemy zbudować wszystkiego od zera. Próbujemy inteligentnie wykorzystać to, co już działa, i skupić się na polskiej specjalizacji.

Struktura i reprodukcja
Repozytorium jest podzielone na:

bench/ — harness ewaluacyjny (MCQ, PoQuAD + judge, FLORES, GSM8K)
results/ — wyniki, leaderboard.json, status.json
*.html + assets/ — modularna strona slayer.fabryka.ai
Wyniki i metodyka są otwarte (MIT). Instrukcja reprodukcji jest w README: wystarczy ollama, Python 3.10+ i jedna komenda, żeby uruchomić benchmark.

Współpraca
Szukamy ludzi i organizacji: korpusy prawno-urzędowe, ewaluacje, trening, infrastruktura, use case'y i fundatorzy compute. Próg wejścia jest niski — są zadania od początkujących.

Co dalej?
W kolejnym wpisie weźmiemy Probierz — nasz kamień probierczy dla modeli AI. Pokażemy, dlaczego większość publicznych benchmarków jest zepsuta i jak budujemy coś, czego nie da się ograć.