W poprzednich wpisach opisaliśmy zamknięte benchmarki. Teraz pokażemy, jak mierzymy postęp w czasie rzeczywistym — konsola, która pokazuje, ile wiedzy już wstrzyknęliśmy w model.
CPT 2B high-quality tokens
program wiedzy →
Co wstrzykujemy
Prawo, administracja, edukacja — akty prawne, orzeczenia, materiały egzaminacyjne
Gospodarka lokalna — regionalne dane, statystyki, informacje lokalne
Dokumenty publiczne — urzędowe, samorządowe, rządowe
Długi ogon polskiej wiedzy — fakty, których nie ma w globalnych korpusach
Źródła danych
Książki, artykuły, poradniki
Wikipedia/encyklopedie po dedupie
Materiały edukacyjne
Dokumentacja techniczna, kod, API, narzędzia
Teksty strukturalne
Cele
Retencja ogólnych kompetencji
Ograniczenie zapominania
Materiał pod pozniejsze RLVR/GRPO
Sanity-check reasoning
Bramki jakości
Każdy dokument przechodzi przez bramki wejścia:
Licencja
Language ID
Boilerplate removal
Exact/near dedup
PII policy
Contamination check
Quality score
Split holdout
Stan: 2026-06-13
Skala logarytmiczna
1M → 2B: na starcie każdy pakiet widać, a szczeble 50M / 250M / 1B / 2B pokazują, ile drabiny zostało.
Licznik rośnie wyłącznie o dokumenty, które przeszły bramki jakości (dedup, filtr, decon) — surowe pobrania nie są wliczane.
Konsola pomiaru
Licznik pokazuje realny postęp — nie pobrane gigabajty, ale wstrzykniętą, zweryfikowaną wiedzę.
Dlaczego to ważne
Większość zespołów mówi „trenowaliśmy na X miliardach tokenów", nie precyzując jakości. My pokazujemy, ile czystych, deduplikowanych, zweryfikowanych tokenów wstrzyknęliśmy.
To jest różnica między „dużo danych" a „dużo dobrych danych".
Nawigacja
Poprzedni: Benchmarki zamknięte: odtwarzalność ponad zasięg
Więcej: Konsola pomiaru na żywo · Program wiedzy · GitHub