70B модель на 4 ГБ GPU — без квантизации и дистилляции
AirLLM ужимает потребление памяти так, что 70B-модели запускаются на одной видеокарте с 4 ГБ, а 405B Llama 3.1 — на 8 ГБ, DeepSeek-V3 (671B) — на ~12 ГБ, а разреженная MoE-модель Kimi K3 (2.8T) — вообще на <4 ГБ. Секрет в том, что данные не сжимаются, а стримятся: вместо целого слоя передаётся один эксперт за раз.