W poprzednich wpisach opisaliśmy pomiar na żywo. Teraz pokażemy pełną historię eksperymentów — wszystko, co uruchomiliśmy, z wynikami i danymi.
Log eksperymentów
v2 — KLEJ mix
🤗 model ↗
dane ↗
v1 — Style
🤗 model ↗
dane ↗
Jak to działa
12 eksperymentów · log auto-aktualizowany przez pipeline (pipeline/run_daily.py)
Każdy eksperyment zawiera:
Model na Hugging Face
Zbiór danych treningowych
Pełne wyniki benchmarków
Metadane i konfigurację
Pełna macierz wyników
Macierz base vs v3 vs v4 × benchmarki (kolor = Δ) pokazuje:
Które wersje poprawiły wyniki
Gdzie pojawiła się regresja
Jakie są trendy w czasie
Dlaczego to ważne
Transparentność
Każdy może zobaczyć, co dokładnie zrobiliśmy. Nie ma „czarnych skrzynek" ani tajnych eksperymentów.
Reprodukowalność
Modele i dane są publicznie dostępne. Każdy może powtórzyć nasze wyniki.
Uczciwość
Pokazujemy zarówno sukcesy, jak i porażki. Nie ukrywamy regresji ani nieudanych prób.
Co znajdziesz
Konfiguracje treningu — hiperparametry, dane, metody
Wyniki benchmarków — wszystkie metryki, nie tylko wybrane
Modele — wagi do pobrania i testowania
Dane — zbiory treningowe z dokumentacją
Jak używać
Przeglądaj eksperymenty — znajdź interesujący Cię wariant
Pobierz model — przetestuj na swoich danych
Sprawdź dane — zobacz, na czym trenowaliśmy
Powtórz wyniki — zweryfikuj nasze claims
Nawigacja
Poprzedni: Pomiar na żywo: CPT 2B high-quality tokens
Więcej: Pełny log eksperymentów · Modele na Hugging Face · GitHub