W poprzednich wpisach opisaliśmy przeglądarkę benchmarków. Teraz pokażemy, których benchmarków celowo NIE mierzymy — i dlaczego.
Trzy benchmarki bez otwartych danych
Polish EQ-Bench
Dlaczego nie mierzymy: brak publicznego zbioru pytań: zamknięty leaderboard, zestaw testowy held-out. Nie odtworzymy wyniku.
CPTUB
Dlaczego nie mierzymy: istnieje jako przestrzeń-leaderboard, ale bez pobieralnego datasetu. Nie powtórzymy ewaluacji na równych warunkach. leaderboard
PLCC
Dlaczego nie mierzymy: publiczne są jedynie przykłady; pełny zestaw 600 pytań trzymany prywatnie (anty-kontaminacja). Bez całości brak rzetelnego wyniku. leaderboard
Zasada: odtwarzalność ponad zasięg
Odtwarzalność ponad zasięg
Jeśli nie możemy pobrać zbioru i powtórzyć runu, benchmark nie trafia na tablicę.
Równe warunki
Porównanie ma sens tylko, gdy oba modele przechodzą identyczny, jawny test.
Otwarci na zmianę
Gdy któryś zbiór zostanie udostępniony — przenosimy go na leaderboard i mierzymy.
Dlaczego to ważne
Wielu zespołów chwali się wynikami na zamkniętych benchmarkach. Problem: nikt nie może zweryfikować tych wyników. To jak mówienie „wygrałem wyścig" bez pokazywania trasy i czasu.
My mierzymy tylko to, co każdy może powtórzyć. Dzięki temu nasze wyniki są wiarygodne.
Transparentność
Listujemy te benchmarki jawnie. Nie ukrywamy, że istnieją. Mówimy wprost: „nie mierzymy, bo nie możemy zweryfikować".
Masz dostęp do tych danych? Jeśli możesz legalnie udostępnić zbiór testowy lub harness — odezwij się.
Pomiary publiczne
Wszystkie publiczne pomiary znajdziesz na leaderboard.
Nawigacja
Poprzedni: Przeglądarka benchmarków: zgłaszaj i przeglądaj
Więcej: Pełna lista zamkniętych benchmarków · Leaderboard · GitHub