Подбор локальной LLM по железу: GitHub-проект WhichLLM ранжирует модели бенчмарками
Show HN про репозиторий Andyyyy64/whichllm, который помогает выбрать локальную LLM под конкретный компьютер. В описании прямо обещают ранжирование по бенчмаркам, то есть без гадания на кофейной гуще и чатов про «а потянет ли мой ноут 70B».
Find the local LLM that actually runs and performs best on your hardware. Ranked by real, recency-aware benchmarks, not parameter count. One command, run it instantly. — Язык: Python — Темы: ai, apple-silicon, benchmarks, cli, command-line-tool, gguf, gpu, huggingface, inference, llm, local-llm, ollama, python, vram
whichllm
Найдите лучшую локальную LLM, которая действительно запускается на вашем оборудовании.
Автоматически определяет ваш GPU/CPU/RAM и ранжирует лучшие модели с HuggingFace, подходящие для вашей системы.

Смотрите
$ whichllm --gpu "RTX 4090"
#1 Qwen/Qwen3.6-27B 27.8B Q5_K_M score 92.8 27 t/s
#2 Qwen/Qwen3-32B 32.0B Q4_K_M score 83.0 31 t/s
#3 Qwen/Qwen3-30B-A3B 30.0B Q5_K_M score 82.7 102 t/s
Модель 32B отлично помещается на вашу карту — но whichllm всё равно ставит 27B на #1,
потому что она показывает более высокий результат на реальных бенчмарках и относится к более новой
генерации. Инструмент из серии «что влезет?» по одному лишь размеру выдал бы вам более крупную
модель. В этом и заключается вся суть whichllm. (Обратите внимание на #3: MoE-модель с 102 t/s —
скорость ранжируется по активным параметрам, качество — по общим.)
Что я могу запустить?
Реальные лучшие варианты (снимок 2026-05 — ваши результаты отслеживают живые данные HuggingFace,
это не статический список):
| Hardware | VRAM | Top pick | Speed |
|---|---|---|---|
| RTX 5090 | 32 GB | Qwen3.6-27B · Q6_K · score 94.7 |
~40 t/s |
| RTX 4090 / 3090 | 24 GB | Qwen3.6-27B · Q5_K_M · score 92.8 |
~27 t/s |
| RTX 4060 | 8 GB | Qwen3-14B · Q3_K_M · score 71.0 |
~22 t/s |
| Apple M3 Max | 36 GB | Qwen3.6-27B · Q5_K_M · score 89.4 |
~9 t/s |
| Только CPU | — | gpt-oss-20b (MoE) · Q4_K_M · score 45.2 |
~6 t/s |
whichllm --gpu "<your card>" — чтобы смоделировать любой из этих вариантов перед покупкой.
Полезно? Звезда на GitHub помогает другим людям найти проект — и мне действительно хотелось бы
узнать, что он выбрал для вашей системы: оставьте это в Issues.