W poprzednich wpisach opisaliśmy plany i metody. Teraz pokażemy, jak wygląda prawdziwa praca inżynierska — porażki, artefakty pomiaru i trudne lekcje.
V4 Faza 0: regresja CDSC-E była głównie artefaktem pomiaru
Domknięcie wątku z v3. Po policzeniu wszystkiego na H100: katastrofalny spadek CDSC-E był w ~3/4 artefaktem trybu pomiaru (generacja + parser), a nie uszkodzeniem wag.
v3 to realny zysk na celu (LLMzSzŁ +3.3, makro KLEJ płaskie). Próba naprawy przez merge wag λ=0.3 wyglądała świetnie na n=200 i wywróciła się na n=400 — oddała cały zysk.
Wnioski: mierzyć likelihood, decydować na n≥400, prawdziwy fix to trening anti-collapse, nie mieszanie wag.
Slayer v3 poprawił LLMzSzŁ, ale uderzył w CDSC-E. To jest czerwona flaga
Pierwszy czysty trening v3 dał mocny sygnał na LLMzSzŁ: 66.8 vs 63.5 dla gołej bazy Qwen3.5-27B. Ale po poprawieniu kierunku promptu CDSC-E spadł z 87.0 do 64.5.
To nie jest kosmetyka metryki, tylko realna regresja NLI do zbadania przed jakimkolwiek finalnym claimem.
Munin 1.0 nie zrobił CPT. Receptura wyciekła w nazwie katalogu
Danish Foundation Models wypuścili Munina na Qwen3.5-9B-Base, czyli na bazie z tej samej rodziny, w którą celuje nasz plan CPT. Release note nie zdradza nic.
Ale w repo modelu leży plik prime_rl_finalized.json, a w nim pełna ścieżka runu treningowego. Nazwa katalogu to cała receptura.
Czego się uczymy
Artefakty pomiaru są wszędzie
To, co wygląda jak regresja, często jest błędem w pipeline'ie pomiarowym. Generacja + parsing może zmienić wyniki bardziej niż same wagi modelu.
Mała próbka kłamie
Kalibracja λ=0.3 wyglądała świetnie na n=200 i zawiodła na n=400. Decyzje trzeba podejmować na statystycznie istotnych próbkach.
Czerwone flagi są ważne
Jeśli model poprawia się na jednym benchmarku i psuje na drugim — to nie jest „kompromis". To jest sygnał, że coś fundamentalnego jest nie tak.
Przejrzystść jest rzadkością
Większość zespołów nie publikuje szczegółów treningu. My musimy.
Jak działamy
Mierzymy dokładnie — likelihood, nie tylko generację
Decydujemy na dużych próbkach — n≥400
Badamy regresje — każda czerwona flaga wymaga śledztwa
Publikujemy wszystko — nawet porażki
To jest prawdziwa praca inżynierska
Nie jest to elegancki pipeline z papieru. To jest brudna, trudna praca z artefaktami, błędami i nieoczekiwanymi wynikami. Ale tylko tak można budować coś, co naprawdę działa.
Nawigacja
Poprzedni: Wiedza: wstrzykiwanie polskiego długiego ogona (synthetic CPT)
Więcej: Pełny engineering log · Leaderboard · GitHub