Soup: дообучение 8B-модели на 4GB ноутбучной GPU через layer streaming
Инструмент Soup позволяет дообучать LLM из одного YAML-файла. Layer streaming держит замороженную базу вне VRAM и подаёт в GPU по одному декодерному слою. На RTX 3050 4GB: Llama-3.1-8B-Instruct + NF4 — 119.6 tok/s, пик 3.32 GB. Поддерживает SFT, DPO, QLoRA, GGUF.