← wszystkie wpisy
2026.07.01 2 min

Siedem ścieżek fabryka.ai: od benchmarków do produktów

CodeSOTA, Hardparse, Hermes SDK, Router, Robotnik, ZusWaveBench, Bozenka. Jeden klaster — RTX 3090 — i siedem aktywnych projektów łączących badania z produktem.

W poprzednich wpisach pokazaliśmy, jak mierzymy i trenujemy. Teraz pokażemy pełną mapę projektów, które łączą badania AI z działającymi produktami.

fabryka.ai to nie agencja i nie newsletter. To warstwa między artykułami naukowymi o AI a działającymi produktami — benchmark, parse, route, ship. Poniżej pełna lista aktywnych ścieżek.

CodeSOTA
Kontynuacja Papers With Code
Task pages, rankingi modeli, notatki o dowodach i praktyczne wskazówki, który model wybrać.

Benchmarki według zadań
Zadania pogrupowane tematycznie, z wyraźnymi metrykami.

Redakcyjny wybór modeli
Nie tylko surowe liczby — też kontekst, kiedy który model faktycznie działa.

Dowody zamiast obietnic vendorów
Wybór modelu oparty na publicznych, powtarzalnych wynikach, nie na marketingu.

codesota.com

Hardparse
Parsowanie dokumentów i OCR
Infrastruktura wydzielona z pracy benchmarkowej: paragony, PDF-y, tabele, layouty, porównania modeli.

Pipeline'y OCR
OCR dla skanów i zdjęć dokumentów.

Parsowanie PDF-ów i obrazów
Wydobywanie struktury, tabel i tekstu z dokumentów.

Ewaluacja na bałaganiarskich dokumentach
Testujemy na realnych, nieuporządkowanych danych, nie na idealnych próbkach.

hardparse.com

Hermes SDK
Runtime dla systemów agentowych
SDK i runtime do agentów, tool use, lokalnego wykonania, routingu i praktycznych badań nad automatyzacją.

Runtime agentów
Szkielet do uruchamiania agentów.

Bramki narzędziowe
Jednolity sposób, by agenci wywoływali narzędzia.

Lokalne + hostowane wykonanie
Elastyczność: małe modele lokalnie, duże w chmurze.

GitHub

Router
Jeden endpoint, wiele modeli
Własny router inferencji. Wysyła każdy request do właściwego modelu i providera, balansując jakość, opóźnienie i koszt.

Jeden endpoint, wiele modeli
Jedno API, wiele backendów.

Routing po jakości, koszcie, opóźnieniu
Dla każdego zapytania wybieramy optymalny model.

Open-weight + hostowane backendy
Obsługa zarówno własnych wag, jak i komercyjnych providerów.

router.fabryka.ai

Robotnik
AI coworker w Microsoft Teams
Czyta wątki i załączniki, odpowiada w kanale i wykonuje realną pracę przez Graph API — nie kolejny standalone chatbot.

Żyje w Teams
Działa tam, gdzie pracują zespoły.

Czyta wątki + załączniki
Rozumie kontekst rozmów i dokumentów.

Działa przez Graph API
Realna integracja z Microsoft 365, nie tylko chat.

fabryka.ai/robotnik

ZusWaveBench
Polski benchmark urzędniczej logiki
48 zadań w 11 domenach polskiego rozumowania biurokratycznego, oceniane deterministyczną punktacją, nie sądem LLM-a.

48 zadań, 11 domen
Administracja, podatki, ZUS, e-government, rejestry, pisma.

Deterministyczny scorer
Wynik 0–1 bez subiektywnego sądu modelu.

Publiczny, żywy leaderboard
Wyniki i odpowiedzi modeli dostępne dla każdego.

kwikiel.github.io/ZusWaveBench

Bozenka
Polski głos offline
Fine-tuning XTTS-v2 na własnym RTX 3090 — pełny pipeline od surowego audio do wytrenowanego checkpointu, budowany publicznie.

Fine-tune XTTS-v2
Bazowy model z odświeżonym brzmieniem.

Trenowane na 3090
Cały trening na jednej karcie w laboratorium.

Budowane w publicznie dostępnym logu
Każdy krok dokumentowany.

kwikiel.github.io/new-model-every-day

Jeden klaster: RTX 3090, kolejka i taste
To celowo małe. Nie udajemy hyperscalera. Chodzi o to, żeby mieć tyle mocy, ile trzeba do odtwarzania runów, testowania modeli open-weight, porównywania pipeline'ów OCR i trzymania eksperymentów z agentami w ryzach — zanim cokolwiek trafi na hostowaną infrastrukturę.

Cel: zero do 100k miesięcznie do lipca 2027
Publiczna deklaracja, nie obietnica dla inwestorów. Budowane w otwartych repozytoriach, z publicznymi benchmarkami i opisanym procesem.

Nawigacja
Poprzedni: Log eksperymentów: pełna macierz wyników

Więcej: fabryka.ai · GitHub