LINUX.ORG.RU

Использование VRAM при взаимодействии с MCP

 , ,


0

1

Имею llama.cpp, https://huggingface.co/unsloth/Qwen3-Coder-30B-A3B-Instruct-GGUF

# llama-server --host 0.0.0.0 --port 8000 -m ./Qwen3-Coder-30B-A3B-Instruct-IQ4_NL.gguf --jinja --temp 0.7 --min-p 0.0 --top-p 0.80 --top-k 20 --repeat-penalty 1.05 -fa off -lm mlock --n-cpu-moe 99 -c 100000 --cache-type-k q8_0

Запускается, занимает 14637M VRAM.

Иду в web морду, делаю запрос вида «вот тебе код проекта (текст файлов в запросе), переведи комментарии на английский»
Запрос успешен, занятая VRAM увеличивается ну может быть до условных 14700M и сидит на этом уровне как долго его запросами не закидывай.

Второй вариант: беру https://github.com/Luxshan2000/fastmcp-file-server подключаю к llama.cpp серверу, делаю запрос «в директории $$$ проекта прочитай файлы [список относительных путей до всех нужных к переводу файлов] выполни перевод всех китайских сообщений на английский язык.»
Оно доходит до запроса MCP на чтение файла и с этого момента начинает медленно и уверенно «выедать» VRAM.
Далее оно или упадёт в OOM или закончит, но VRAM не высвободит.

Объясните почему так во втором варианте, можно ли его как-то заставить хотябы высвобождать VRAM по завершению запроса?

★★★

попробуй сделать следующий тест:

  1. выключи MCP у llama-cpp
  2. поставь любой агент opencode,hermes,openhands,pi (я советую pi, opencode мейнстрим)
  3. настрой в этом агенте подключение к mcp серверу (самое простое через stdio)
  4. запусти агент, убедись что к mcp есть подключение, настрой его так чтобы использовалась модель llama-cpp
  5. повтори запрос

в llama-cpp поддержка mcp протокола появилась недавно, поэтому есть нюансы, сначала убедись что все нормально работает через агента

gagarin0
()
  • Markdown
Пустая строка (два раза Enter) начинает новый абзац. Знак '>' в начале абзаца выделяет абзац курсивом цитирования.
Внимание: прочитайте описание разметки Markdown.
Используйте Ctrl-Enter для размещения комментария