W poprzednich wpisach pokazaliśmy, jak mierzymy i trenujemy. Teraz pokażemy pełną mapę projektów, które łączą badania AI z działającymi produktami.
fabryka.ai to nie agencja i nie newsletter. To warstwa między artykułami naukowymi o AI a działającymi produktami — benchmark, parse, route, ship. Poniżej pełna lista aktywnych ścieżek.
CodeSOTA
Kontynuacja Papers With Code
Task pages, rankingi modeli, notatki o dowodach i praktyczne wskazówki, który model wybrać.
Benchmarki według zadań
Zadania pogrupowane tematycznie, z wyraźnymi metrykami.
Redakcyjny wybór modeli
Nie tylko surowe liczby — też kontekst, kiedy który model faktycznie działa.
Dowody zamiast obietnic vendorów
Wybór modelu oparty na publicznych, powtarzalnych wynikach, nie na marketingu.
codesota.com
Hardparse
Parsowanie dokumentów i OCR
Infrastruktura wydzielona z pracy benchmarkowej: paragony, PDF-y, tabele, layouty, porównania modeli.
Pipeline'y OCR
OCR dla skanów i zdjęć dokumentów.
Parsowanie PDF-ów i obrazów
Wydobywanie struktury, tabel i tekstu z dokumentów.
Ewaluacja na bałaganiarskich dokumentach
Testujemy na realnych, nieuporządkowanych danych, nie na idealnych próbkach.
hardparse.com
Hermes SDK
Runtime dla systemów agentowych
SDK i runtime do agentów, tool use, lokalnego wykonania, routingu i praktycznych badań nad automatyzacją.
Runtime agentów
Szkielet do uruchamiania agentów.
Bramki narzędziowe
Jednolity sposób, by agenci wywoływali narzędzia.
Lokalne + hostowane wykonanie
Elastyczność: małe modele lokalnie, duże w chmurze.
GitHub
Router
Jeden endpoint, wiele modeli
Własny router inferencji. Wysyła każdy request do właściwego modelu i providera, balansując jakość, opóźnienie i koszt.
Jeden endpoint, wiele modeli
Jedno API, wiele backendów.
Routing po jakości, koszcie, opóźnieniu
Dla każdego zapytania wybieramy optymalny model.
Open-weight + hostowane backendy
Obsługa zarówno własnych wag, jak i komercyjnych providerów.
router.fabryka.ai
Robotnik
AI coworker w Microsoft Teams
Czyta wątki i załączniki, odpowiada w kanale i wykonuje realną pracę przez Graph API — nie kolejny standalone chatbot.
Żyje w Teams
Działa tam, gdzie pracują zespoły.
Czyta wątki + załączniki
Rozumie kontekst rozmów i dokumentów.
Działa przez Graph API
Realna integracja z Microsoft 365, nie tylko chat.
fabryka.ai/robotnik
ZusWaveBench
Polski benchmark urzędniczej logiki
48 zadań w 11 domenach polskiego rozumowania biurokratycznego, oceniane deterministyczną punktacją, nie sądem LLM-a.
48 zadań, 11 domen
Administracja, podatki, ZUS, e-government, rejestry, pisma.
Deterministyczny scorer
Wynik 0–1 bez subiektywnego sądu modelu.
Publiczny, żywy leaderboard
Wyniki i odpowiedzi modeli dostępne dla każdego.
kwikiel.github.io/ZusWaveBench
Bozenka
Polski głos offline
Fine-tuning XTTS-v2 na własnym RTX 3090 — pełny pipeline od surowego audio do wytrenowanego checkpointu, budowany publicznie.
Fine-tune XTTS-v2
Bazowy model z odświeżonym brzmieniem.
Trenowane na 3090
Cały trening na jednej karcie w laboratorium.
Budowane w publicznie dostępnym logu
Każdy krok dokumentowany.
kwikiel.github.io/new-model-every-day
Jeden klaster: RTX 3090, kolejka i taste
To celowo małe. Nie udajemy hyperscalera. Chodzi o to, żeby mieć tyle mocy, ile trzeba do odtwarzania runów, testowania modeli open-weight, porównywania pipeline'ów OCR i trzymania eksperymentów z agentami w ryzach — zanim cokolwiek trafi na hostowaną infrastrukturę.
Cel: zero do 100k miesięcznie do lipca 2027
Publiczna deklaracja, nie obietnica dla inwestorów. Budowane w otwartych repozytoriach, z publicznymi benchmarkami i opisanym procesem.
Nawigacja
Poprzedni: Log eksperymentów: pełna macierz wyników
Więcej: fabryka.ai · GitHub