11 августа опубликован FastFlowLM 1.0, первый общий выпуск проекта после его перехода под управление AMD. FastFlowLM представляет собой систему локального запуска больших языковых и мультимодальных моделей на NPU в процессорах AMD Ryzen AI, ориентированную на похожий на Ollama сценарий работы, но с использованием нейропроцессора вместо GPU.
Переход имеет для проекта особое значение: 17 июля команда FastFlowLM присоединилась к AMD, а разработка была переведена из FastFlowLM/FastFlowLM в организацию ROCm на GitHub. AMD заявила, что FastFlowLM войдёт в программный стек компании для клиентских систем и рабочих станций с ИИ-ускорителями. При переносе сохранены история репозитория, issues и pull requests, а все последующие выпуски будут публиковаться в ROCm/FastFlowLM.
FastFlowLM предназначен для NPU архитектуры AMD XDNA2 и поддерживает семейства Ryzen AI Strix Point, Strix Halo, Kraken Point и Gorgon Point. Проект позволяет запускать на NPU языковые и vision-language модели, модели распознавания речи, embeddings и MoE. Заявлена поддержка контекстного окна вплоть до 256 тыс. токенов для некоторых моделей. Размер самого runtime составляет около 17 МБ.
Основные изменения FastFlowLM 1.0:
-
Добавлена поддержка SmolVLA. Это первая в FastFlowLM Vision-Language-Action модель для робототехники, которая преобразует изображения с камер и текстовые инструкции непосредственно в действия робота. Поддерживается ввод одновременно с трёх камер. В отличие от обычных LLM, SmolVLA не запускается через стандартные диалоговые режимы
flm runиflm serve. -
Расширен инструмент тестирования
flm bench. По умолчанию бенчмарк теперь проводит по два измерения для каждой длины контекста от 1K до 32K токенов. Число проходов можно изменить через новый параметр--bench-iterations, напримерflm bench --bench-iterations 4. -
Исправлена обработка нескольких изображений в Qwen3-VL. При передаче двух изображений в одном запросе вариант
qwen3vl-itмог не распознать ни одно из них. В версии 1.0 обработка таких multi-image запросов исправлена. -
Разработка окончательно перенесена в ROCm. Версия 1.0 стала первым релизом из репозитория
ROCm/FastFlowLM. Предыдущий выпуск 0.9.46 был последним релизом до завершения организационного перехода к AMD.
Под Linux FastFlowLM официально документирует работу в Ubuntu 24.04 LTS, Ubuntu 25.10 и Arch Linux, предусмотрен также вариант установки для других дистрибутивов. Для доступа к NPU необходимы драйвер amdxdna, прошивка NPU версии не ниже 1.1.0.0 и пользовательский стек AMD XRT. Драйвер amdxdna входит в ядро Linux начиная с версии 7.0, для других конфигураций предлагается DKMS-вариант. FastFlowLM можно установить готовым .deb-пакетом или собрать из исходного кода при помощи CMake.
Для приложений FastFlowLM предоставляет CLI, REST API и API, совместимый с OpenAI, благодаря чему NPU можно использовать в качестве локального бэкенда для существующих интерфейсов и программ, работающих с языковыми моделями.
При этом лицензирование проекта имеет особенность. Оркестрационный код и CLI FastFlowLM опубликованы под лицензией MIT, тогда как оптимизированные бинарные ядра для NPU распространяются отдельно и разрешены для бесплатного использования, в том числе коммерческого. Низкоуровневая часть проекта опирается на разработанные AMD открытые технологии IRON и AIE-MLIR.
Исходный код FastFlowLM 1.0, готовые пакеты и документация доступны в репозитории ROCm/FastFlowLM.
>>> Источник