W poprzednich wpisach opisaliśmy datasety i dane. Teraz pokażemy, jak z nich korzystamy — jakie metody treningu działają w 2026, jak oszczędzać pieniądze i dlaczego nie rozszerzamy tokenizera.
Lineage — co działa w 2026, co było modą 2025
RLHF/PPO → DPO (2023) → GRPO+RLVR (2025, króluje przy weryfikowalnej nagrodzie).
2026: SFT (QLoRA) → DPO/ORPO → GRPO/RLVR na egzaminach.
Nie: RLHF-PPO z modelem nagrody (wyparte); IPO i process-reward modele okazały się niszowe. KTO/SimPO = tańsze alternatywy DPO.
1 · Dane
Mały, czysty zbiór instrukcji PL > duży i brudny (LIMA).
Magpie, Evol-Instruct, self-instruct → filtruj. ISAP, SAOS → pary „kontekst→odpowiedź z cytatem". n-gram/embedding overlap vs zbiory testowe.
2 · SFT
4-bit + adaptery → 11–14B na jednym GPU. Bliżej full-FT przy podobnym koszcie. 2–4× szybciej, mniej VRAM. Darmowy zysk jakości i przepustowości.
3 · Preferencje
Pary lepsza/gorsza, stabilne, bez modelu nagrody. SFT + preferencje naraz, bez modelu ref. Ref-free / bez par — łatwiej o dane. Generuj → oceń (RLAIF) → dotrenuj, w pętli.
4 · RL na weryfikowalnych nagrodach
RL bez modelu wartości. Nagroda = poprawna litera. Egzaminy mają klucz → tania, mocna nagroda. Łańcuchy myślenia z mocnego nauczyciela.
5 · Tanie triki budżetowe
mergekit TIES/DARE/SLERP — często darmowy zysk. Krótsze sekwencje, tańszy inference. YaRN/RoPE-scaling pod długie pisma. Start z mocniejszej bazy — stąd leaderboard.
Tokenizer — dlaczego nie rozszerzamy
Zmierzyliśmy fertility na tej samej próbce Wikipedii (PL+EN). Tokenizer Qwena jest ~23% wydajniejszy na polskim niż tokenizer Mistrala — tańszy inference i dłuższy efektywny kontekst (ważne dla długich pism).
Przewagę dostajemy za darmo, wyborem bazy.
Rekomendowana recepta
Wybierz bazę
Wg leaderboardu — start z mocniejszej = najtańszy zysk.
QLoRA SFT
Kurowane PL + domenowe, Unsloth/Liger.
ORPO / DPO
Preferencje; ORPO oszczędza etap i VRAM.
GRPO/RLVR na egzaminach
Weryfikowalna nagroda pod target.
Odmowa + RAG-aware
Grounding i „nie wiem" na niezależnych danych.
Merging
mergekit między checkpointami; mierz na held-out.
Czystość
Żadnej metody nie kierujemy na dane testowe. Metodologia
Nawigacja
Poprzedni: Datasety: ewaluacja i trening
Więcej: Pełne metody treningu · Metodologia · GitHub