📰 IT Дайджест

← К выпуску 16.05.2026

Hugging Face без шума: подобрать локальную LLM под своё железо теперь можно по бенчмаркам

github.com · #ai #benchmarks #llm #local #show-hn

В show HN выложили репозиторий whichllm — проект ранжирует локальные LLM по бенчмаркам, чтобы не гадать, влезет ли модель в вашу видеокарту или устроит ли она слайд-шоу на CPU. Судя по интересу на HN, людям надоело подбирать модель методом «поставил, запустил, увидел 0.8 токена/сек и ушёл пить чай».

Открыть оригинал →

Find the local LLM that actually runs and performs best on your hardware. Ranked by real, recency-aware benchmarks, not parameter count. One command, run it instantly. — Язык: Python — Темы: ai, apple-silicon, benchmarks, cli, command-line-tool, gguf, gpu, huggingface, inference, llm, local-llm, ollama, python, vram

whichllm

Версия PyPI
Python 3.11+
Лицензия: MIT
Тесты

Найдите лучшую локальную LLM, которая действительно запускается на вашем оборудовании.

Автоматически определяет ваш GPU/CPU/RAM и ранжирует лучшие модели с HuggingFace, подходящие для вашей системы.

日本語版はこちら

demo

Смотрите

$ whichllm --gpu "RTX 4090"

#1  Qwen/Qwen3.6-27B     27.8B  Q5_K_M   score 92.8    27 t/s
#2  Qwen/Qwen3-32B       32.0B  Q4_K_M   score 83.0    31 t/s
#3  Qwen/Qwen3-30B-A3B   30.0B  Q5_K_M   score 82.7   102 t/s

Модель 32B отлично помещается на вашу карту — но whichllm всё равно ставит 27B на #1,
потому что она показывает более высокий результат на реальных бенчмарках и относится к более новой
генерации. Инструмент из серии «что влезет?» по одному лишь размеру выдал бы вам более крупную
модель. В этом и заключается вся суть whichllm. (Обратите внимание на #3: MoE-модель с 102 t/s —
скорость ранжируется по активным параметрам, качество — по общим.)

Что я могу запустить?

Реальные лучшие варианты (снимок 2026-05 — ваши результаты отслеживают живые данные HuggingFace,
это не статический список):

Hardware VRAM Top pick Speed
RTX 5090 32 GB Qwen3.6-27B · Q6_K · score 94.7 ~40 t/s
RTX 4090 / 3090 24 GB Qwen3.6-27B · Q5_K_M · score 92.8 ~27 t/s
RTX 4060 8 GB Qwen3-14B · Q3_K_M · score 71.0 ~22 t/s
Apple M3 Max 36 GB Qwen3.6-27B · Q5_K_M · score 89.4 ~9 t/s
Только CPU gpt-oss-20b (MoE) · Q4_K_M · score 45.2 ~6 t/s

whichllm --gpu "<your card>" — чтобы смоделировать любой из этих вариантов перед покупкой.

Полезно? Звезда на GitHub помогает другим людям найти проект — и мне действительно хотелось бы
узнать, что он выбрал для вашей системы: оставьте это в Issues.