← wszystkie wpisy
2026.06.30 1 min

Benchmarki zamknięte: odtwarzalność ponad zasięg

Tych benchmarków nie mierzymy — ich zbiory testowe nie są publicznie dostępne. Polish EQ-Bench, CPTUB, PLCC. Zasada: jeśli nie możemy powtórzyć, nie porównujemy.

W poprzednich wpisach opisaliśmy przeglądarkę benchmarków. Teraz pokażemy, których benchmarków celowo NIE mierzymy — i dlaczego.

Trzy benchmarki bez otwartych danych
Polish EQ-Bench
Dlaczego nie mierzymy: brak publicznego zbioru pytań: zamknięty leaderboard, zestaw testowy held-out. Nie odtworzymy wyniku.

CPTUB
Dlaczego nie mierzymy: istnieje jako przestrzeń-leaderboard, ale bez pobieralnego datasetu. Nie powtórzymy ewaluacji na równych warunkach. leaderboard

PLCC
Dlaczego nie mierzymy: publiczne są jedynie przykłady; pełny zestaw 600 pytań trzymany prywatnie (anty-kontaminacja). Bez całości brak rzetelnego wyniku. leaderboard

Zasada: odtwarzalność ponad zasięg
Odtwarzalność ponad zasięg
Jeśli nie możemy pobrać zbioru i powtórzyć runu, benchmark nie trafia na tablicę.

Równe warunki
Porównanie ma sens tylko, gdy oba modele przechodzą identyczny, jawny test.

Otwarci na zmianę
Gdy któryś zbiór zostanie udostępniony — przenosimy go na leaderboard i mierzymy.

Dlaczego to ważne
Wielu zespołów chwali się wynikami na zamkniętych benchmarkach. Problem: nikt nie może zweryfikować tych wyników. To jak mówienie „wygrałem wyścig" bez pokazywania trasy i czasu.

My mierzymy tylko to, co każdy może powtórzyć. Dzięki temu nasze wyniki są wiarygodne.

Transparentność
Listujemy te benchmarki jawnie. Nie ukrywamy, że istnieją. Mówimy wprost: „nie mierzymy, bo nie możemy zweryfikować".

Masz dostęp do tych danych? Jeśli możesz legalnie udostępnić zbiór testowy lub harness — odezwij się.

Pomiary publiczne
Wszystkie publiczne pomiary znajdziesz na leaderboard.

Nawigacja
Poprzedni: Przeglądarka benchmarków: zgłaszaj i przeglądaj

Więcej: Pełna lista zamkniętych benchmarków · Leaderboard · GitHub