LINUX.ORG.RU

FastFlowLM 1.0

 , fastflowlm, ,

FastFlowLM 1.0

1

2

11 августа опубликован FastFlowLM 1.0, первый общий выпуск проекта после его перехода под управление AMD. FastFlowLM представляет собой систему локального запуска больших языковых и мультимодальных моделей на NPU в процессорах AMD Ryzen AI, ориентированную на похожий на Ollama сценарий работы, но с использованием нейропроцессора вместо GPU.

Переход имеет для проекта особое значение: 17 июля команда FastFlowLM присоединилась к AMD, а разработка была переведена из FastFlowLM/FastFlowLM в организацию ROCm на GitHub. AMD заявила, что FastFlowLM войдёт в программный стек компании для клиентских систем и рабочих станций с ИИ-ускорителями. При переносе сохранены история репозитория, issues и pull requests, а все последующие выпуски будут публиковаться в ROCm/FastFlowLM.

FastFlowLM предназначен для NPU архитектуры AMD XDNA2 и поддерживает семейства Ryzen AI Strix Point, Strix Halo, Kraken Point и Gorgon Point. Проект позволяет запускать на NPU языковые и vision-language модели, модели распознавания речи, embeddings и MoE. Заявлена поддержка контекстного окна вплоть до 256 тыс. токенов для некоторых моделей. Размер самого runtime составляет около 17 МБ.

Основные изменения FastFlowLM 1.0:

  • Добавлена поддержка SmolVLA. Это первая в FastFlowLM Vision-Language-Action модель для робототехники, которая преобразует изображения с камер и текстовые инструкции непосредственно в действия робота. Поддерживается ввод одновременно с трёх камер. В отличие от обычных LLM, SmolVLA не запускается через стандартные диалоговые режимы flm run и flm serve.

  • Расширен инструмент тестирования flm bench. По умолчанию бенчмарк теперь проводит по два измерения для каждой длины контекста от 1K до 32K токенов. Число проходов можно изменить через новый параметр --bench-iterations, например flm bench --bench-iterations 4.

  • Исправлена обработка нескольких изображений в Qwen3-VL. При передаче двух изображений в одном запросе вариант qwen3vl-it мог не распознать ни одно из них. В версии 1.0 обработка таких multi-image запросов исправлена.

  • Разработка окончательно перенесена в ROCm. Версия 1.0 стала первым релизом из репозитория ROCm/FastFlowLM. Предыдущий выпуск 0.9.46 был последним релизом до завершения организационного перехода к AMD.

Под Linux FastFlowLM официально документирует работу в Ubuntu 24.04 LTS, Ubuntu 25.10 и Arch Linux, предусмотрен также вариант установки для других дистрибутивов. Для доступа к NPU необходимы драйвер amdxdna, прошивка NPU версии не ниже 1.1.0.0 и пользовательский стек AMD XRT. Драйвер amdxdna входит в ядро Linux начиная с версии 7.0, для других конфигураций предлагается DKMS-вариант. FastFlowLM можно установить готовым .deb-пакетом или собрать из исходного кода при помощи CMake.

Для приложений FastFlowLM предоставляет CLI, REST API и API, совместимый с OpenAI, благодаря чему NPU можно использовать в качестве локального бэкенда для существующих интерфейсов и программ, работающих с языковыми моделями.

При этом лицензирование проекта имеет особенность. Оркестрационный код и CLI FastFlowLM опубликованы под лицензией MIT, тогда как оптимизированные бинарные ядра для NPU распространяются отдельно и разрешены для бесплатного использования, в том числе коммерческого. Низкоуровневая часть проекта опирается на разработанные AMD открытые технологии IRON и AIE-MLIR.

Исходный код FastFlowLM 1.0, готовые пакеты и документация доступны в репозитории ROCm/FastFlowLM.

>>> Источник

★★★★★

Проверено: cetjs2 ()

Интересный проект. Ещё бы проц такой заиметь.

nuxster ★★★★★
()

Заявлена поддержка контекстного окна вплоть до 256 тыс. токенов для некоторых моделей. Размер самого runtime составляет около 17 МБ.

По современным меркам вроде как совсем ни о чем. Если имеются в виду, что 17Мб отведено под веса при инференсе, то ничего адекватного на таком объеме запустить не получится. А блин, не 17Gb? То есть, это размер бинарника?

Xintrea ★★★★★
()
Последнее исправление: Xintrea (всего исправлений: 1)

с использованием нейропроцессора вместо GPU

Где-нибудь вкратце можно прочесть — какая выгода от этого?

greenman ★★★★★
()
Ответ на: комментарий от Xintrea

Не, 17 мб это размер самого софта, но не весов. Веса могут как раз занимать гигабайты.

Сформулировал неудачно.

unclestephen ★★★★★
() автор топика
Ответ на: комментарий от greenman

Выгода в том, что у Ryzen Ai до 128 гигов ОЗУ из которых 96 можно отдать под VRAM и как следствие под ИИ (или видео).

Такой объем видеопамяти получить на GPU влетит в копеечку.

unclestephen ★★★★★
() автор топика
Ответ на: комментарий от unclestephen

как следствие под ИИ (или видео)

Т.е. эта пямять доступна как NPU, так и GPU. А вопрос был — в чём преимущество использования NPU в сравнении с GPU (этот GPU присутствует же в этом Ryzen, да?). Для упомянутых задач. С бенчмарками, очень желательно.

greenman ★★★★★
()
Последнее исправление: greenman (всего исправлений: 1)
Ответ на: комментарий от greenman

У видеокарты на 96 гигов (например RTX6000 PRO), цена 1,5КК а рязань на 128 гигов встроенной памяти стоит 0,5КК, и на ней можно запускать большие модели.

Как это работает я не знаю, бенчмарки можно найти в сети.

Короче я вижу профит в этом.

unclestephen ★★★★★
() автор топика
Ответ на: комментарий от unclestephen

рязань на 128 гигов встроенной памяти стоит 0,5КК, и на ней можно запускать большие модели.

На ней можно запускать «большие модели» и без NPU. На встроенном GPU.

В твоей же теме было. Посоветуйте железо для подкроватного сервера ИИ (комментарий)

Да, небысто. Так и вопрос в том, насколько быстрее будет с NPU. Если вообще возможно быстрее, если всё в доступ к памяти упирается.

В общем, твой ответ уже понятен. Может кто-нибудь знающий дополнит.

greenman ★★★★★
()
Последнее исправление: greenman (всего исправлений: 1)
Ответ на: комментарий от greenman

Энергопотребление в разы меньше, емли я правильно понимаю.

vbcnthfkmnth123 ★★★★★
()
Ответ на: комментарий от greenman

NPU (Neural Processing Unit) как не удивительно :) более заточена под работу «Neural Processing» чем GPU :) т.е. для работы ИИ более подходят и размерности переменных и логика работы аппаратной математики - быстрее и энергоэффективнее.
но на данный момент технология npu еще развивается. поэтому разница заметна не так сильно. плюс в последние GPGPU внедряются алгоритмы «Neural Processing».
та же ситуация что и при создании ASIC бетховенов и прочих крипто-вычислений.

pfg ★★★★★
()
Последнее исправление: pfg (всего исправлений: 1)
Для того чтобы оставить комментарий войдите или зарегистрируйтесь.