← wszystkie wpisy
2026.06.30 1 min

Pomiar na żywo: CPT 2B high-quality tokens

Konsola pomiaru postępu wstrzykiwania wiedzy. Prawo, administracja, edukacja, gospodarka lokalna. Skala logarytmiczna, bramki jakości, deduplikacja.

W poprzednich wpisach opisaliśmy zamknięte benchmarki. Teraz pokażemy, jak mierzymy postęp w czasie rzeczywistym — konsola, która pokazuje, ile wiedzy już wstrzyknęliśmy w model.

CPT 2B high-quality tokens
program wiedzy →

Co wstrzykujemy
Prawo, administracja, edukacja — akty prawne, orzeczenia, materiały egzaminacyjne
Gospodarka lokalna — regionalne dane, statystyki, informacje lokalne
Dokumenty publiczne — urzędowe, samorządowe, rządowe
Długi ogon polskiej wiedzy — fakty, których nie ma w globalnych korpusach
Źródła danych
Książki, artykuły, poradniki
Wikipedia/encyklopedie po dedupie
Materiały edukacyjne
Dokumentacja techniczna, kod, API, narzędzia
Teksty strukturalne

Cele
Retencja ogólnych kompetencji
Ograniczenie zapominania
Materiał pod pozniejsze RLVR/GRPO
Sanity-check reasoning
Bramki jakości
Każdy dokument przechodzi przez bramki wejścia:

Licencja
Language ID
Boilerplate removal
Exact/near dedup
PII policy
Contamination check
Quality score
Split holdout
Stan: 2026-06-13

Skala logarytmiczna
1M → 2B: na starcie każdy pakiet widać, a szczeble 50M / 250M / 1B / 2B pokazują, ile drabiny zostało.

Licznik rośnie wyłącznie o dokumenty, które przeszły bramki jakości (dedup, filtr, decon) — surowe pobrania nie są wliczane.

Konsola pomiaru
Licznik pokazuje realny postęp — nie pobrane gigabajty, ale wstrzykniętą, zweryfikowaną wiedzę.

Dlaczego to ważne
Większość zespołów mówi „trenowaliśmy na X miliardach tokenów", nie precyzując jakości. My pokazujemy, ile czystych, deduplikowanych, zweryfikowanych tokenów wstrzyknęliśmy.

To jest różnica między „dużo danych" a „dużo dobrych danych".

Nawigacja
Poprzedni: Benchmarki zamknięte: odtwarzalność ponad zasięg

Więcej: Konsola pomiaru na żywo · Program wiedzy · GitHub