← wszystkie wpisy
2026.06.30 2 min

Trening: metody fine-tuningu (SOTA 2026)

Jak trenować tanio i czysto. QLoRA SFT, ORPO/DPO, GRPO/RLVR na egzaminach. Co działa w 2026, co było modą 2025.

W poprzednich wpisach opisaliśmy datasety i dane. Teraz pokażemy, jak z nich korzystamy — jakie metody treningu działają w 2026, jak oszczędzać pieniądze i dlaczego nie rozszerzamy tokenizera.

Lineage — co działa w 2026, co było modą 2025
RLHF/PPO → DPO (2023) → GRPO+RLVR (2025, króluje przy weryfikowalnej nagrodzie).

2026: SFT (QLoRA) → DPO/ORPO → GRPO/RLVR na egzaminach.

Nie: RLHF-PPO z modelem nagrody (wyparte); IPO i process-reward modele okazały się niszowe. KTO/SimPO = tańsze alternatywy DPO.

1 · Dane
Mały, czysty zbiór instrukcji PL > duży i brudny (LIMA).

Magpie, Evol-Instruct, self-instruct → filtruj. ISAP, SAOS → pary „kontekst→odpowiedź z cytatem". n-gram/embedding overlap vs zbiory testowe.

2 · SFT
4-bit + adaptery → 11–14B na jednym GPU. Bliżej full-FT przy podobnym koszcie. 2–4× szybciej, mniej VRAM. Darmowy zysk jakości i przepustowości.

3 · Preferencje
Pary lepsza/gorsza, stabilne, bez modelu nagrody. SFT + preferencje naraz, bez modelu ref. Ref-free / bez par — łatwiej o dane. Generuj → oceń (RLAIF) → dotrenuj, w pętli.

4 · RL na weryfikowalnych nagrodach
RL bez modelu wartości. Nagroda = poprawna litera. Egzaminy mają klucz → tania, mocna nagroda. Łańcuchy myślenia z mocnego nauczyciela.

5 · Tanie triki budżetowe
mergekit TIES/DARE/SLERP — często darmowy zysk. Krótsze sekwencje, tańszy inference. YaRN/RoPE-scaling pod długie pisma. Start z mocniejszej bazy — stąd leaderboard.

Tokenizer — dlaczego nie rozszerzamy
Zmierzyliśmy fertility na tej samej próbce Wikipedii (PL+EN). Tokenizer Qwena jest ~23% wydajniejszy na polskim niż tokenizer Mistrala — tańszy inference i dłuższy efektywny kontekst (ważne dla długich pism).

Przewagę dostajemy za darmo, wyborem bazy.

Rekomendowana recepta
Wybierz bazę
Wg leaderboardu — start z mocniejszej = najtańszy zysk.

QLoRA SFT
Kurowane PL + domenowe, Unsloth/Liger.

ORPO / DPO
Preferencje; ORPO oszczędza etap i VRAM.

GRPO/RLVR na egzaminach
Weryfikowalna nagroda pod target.

Odmowa + RAG-aware
Grounding i „nie wiem" na niezależnych danych.

Merging
mergekit między checkpointami; mierz na held-out.

Czystość
Żadnej metody nie kierujemy na dane testowe. Metodologia

Nawigacja
Poprzedni: Datasety: ewaluacja i trening

Więcej: Pełne metody treningu · Metodologia · GitHub