Имею llama.cpp, https://huggingface.co/unsloth/Qwen3-Coder-30B-A3B-Instruct-GGUF
# llama-server --host 0.0.0.0 --port 8000 -m ./Qwen3-Coder-30B-A3B-Instruct-IQ4_NL.gguf --jinja --temp 0.7 --min-p 0.0 --top-p 0.80 --top-k 20 --repeat-penalty 1.05 -fa off -lm mlock --n-cpu-moe 99 -c 100000 --cache-type-k q8_0
Запускается, занимает 14637M VRAM.
Иду в web морду, делаю запрос вида «вот тебе код проекта (текст файлов в запросе), переведи комментарии на английский»
Запрос успешен, занятая VRAM увеличивается ну может быть до условных 14700M и сидит на этом уровне как долго его запросами не закидывай.
Второй вариант: беру https://github.com/Luxshan2000/fastmcp-file-server подключаю к llama.cpp серверу, делаю запрос «в директории $$$ проекта прочитай файлы [список относительных путей до всех нужных к переводу файлов] выполни перевод всех китайских сообщений на английский язык.»
Оно доходит до запроса MCP на чтение файла и с этого момента начинает медленно и уверенно «выедать» VRAM.
Далее оно или упадёт в OOM или закончит, но VRAM не высвободит.
Объясните почему так во втором варианте, можно ли его как-то заставить хотябы высвобождать VRAM по завершению запроса?
