← wszystkie wpisy
2026.06.30 2 min

Engineering log: co poszło nie tak i czego się nauczyliśmy

Dziennik inżynierski Slayer AI Lab. Regresja CDSC-E, pułapka małej próbki, czerwone flagi i wyciekłe receptury.

W poprzednich wpisach opisaliśmy plany i metody. Teraz pokażemy, jak wygląda prawdziwa praca inżynierska — porażki, artefakty pomiaru i trudne lekcje.

V4 Faza 0: regresja CDSC-E była głównie artefaktem pomiaru
Domknięcie wątku z v3. Po policzeniu wszystkiego na H100: katastrofalny spadek CDSC-E był w ~3/4 artefaktem trybu pomiaru (generacja + parser), a nie uszkodzeniem wag.

v3 to realny zysk na celu (LLMzSzŁ +3.3, makro KLEJ płaskie). Próba naprawy przez merge wag λ=0.3 wyglądała świetnie na n=200 i wywróciła się na n=400 — oddała cały zysk.

Wnioski: mierzyć likelihood, decydować na n≥400, prawdziwy fix to trening anti-collapse, nie mieszanie wag.

Slayer v3 poprawił LLMzSzŁ, ale uderzył w CDSC-E. To jest czerwona flaga
Pierwszy czysty trening v3 dał mocny sygnał na LLMzSzŁ: 66.8 vs 63.5 dla gołej bazy Qwen3.5-27B. Ale po poprawieniu kierunku promptu CDSC-E spadł z 87.0 do 64.5.

To nie jest kosmetyka metryki, tylko realna regresja NLI do zbadania przed jakimkolwiek finalnym claimem.

Munin 1.0 nie zrobił CPT. Receptura wyciekła w nazwie katalogu
Danish Foundation Models wypuścili Munina na Qwen3.5-9B-Base, czyli na bazie z tej samej rodziny, w którą celuje nasz plan CPT. Release note nie zdradza nic.

Ale w repo modelu leży plik prime_rl_finalized.json, a w nim pełna ścieżka runu treningowego. Nazwa katalogu to cała receptura.

Czego się uczymy
Artefakty pomiaru są wszędzie
To, co wygląda jak regresja, często jest błędem w pipeline'ie pomiarowym. Generacja + parsing może zmienić wyniki bardziej niż same wagi modelu.

Mała próbka kłamie
Kalibracja λ=0.3 wyglądała świetnie na n=200 i zawiodła na n=400. Decyzje trzeba podejmować na statystycznie istotnych próbkach.

Czerwone flagi są ważne
Jeśli model poprawia się na jednym benchmarku i psuje na drugim — to nie jest „kompromis". To jest sygnał, że coś fundamentalnego jest nie tak.

Przejrzystść jest rzadkością
Większość zespołów nie publikuje szczegółów treningu. My musimy.

Jak działamy
Mierzymy dokładnie — likelihood, nie tylko generację
Decydujemy na dużych próbkach — n≥400
Badamy regresje — każda czerwona flaga wymaga śledztwa
Publikujemy wszystko — nawet porażki
To jest prawdziwa praca inżynierska
Nie jest to elegancki pipeline z papieru. To jest brudna, trudna praca z artefaktami, błędami i nieoczekiwanymi wynikami. Ale tylko tak można budować coś, co naprawdę działa.

Nawigacja
Poprzedni: Wiedza: wstrzykiwanie polskiego długiego ogona (synthetic CPT)

Więcej: Pełny engineering log · Leaderboard · GitHub