Вышел llmhost — локальный хостинг LLM с автоматическим управлением памятью и спекулятивным декодированием. Планировщик сам выбирает форму загрузки: целиком на карту, эксперты MoE в RAM или частичный сплит, подбирает контекст от свободной VRAM и запоминает живой замер памяти после каждой загрузки, чтобы следующий план был точнее. MTP-головы цепляются автоматически с проверкой совместимости по GGUF-мете. Всё, что автоматика решает сама, переопределяется в llmhost.conf на лету.
На стенде Blackwell + DDR4: Qwen3-Next-80B-A3B в Q4_K_M с экспертами в RAM и контекстом 262144 выдаёт 35,6 ток/с, с родной MTP-головой 48,9 ток/с. Против Ollama 0.35.1 на том же железе: 26B MoE 197 против 115 ток/с, 27B плотная 54 против 30.
Код на C++20, под капотом ванильный llama.cpp без форков.
Проект на гитхабе. Подробное описание в README.md. Ставится одной командой в консоли под Linux, дальше установщик подскажет. Модели качаются поиском по HuggingFace. Проект в бете, все замеры датированы и привязаны к пинам.
>>> llmhost












