LINUX.ORG.RU

А можно ли сейчас собрать полностью автономного AI-агента на домашнем ПК?

 


0

3

Всем привет.

Появилось ощущение, что локальные LLM постепенно перестают быть просто «чатиком в браузере». Есть Ollama/llama.cpp, различные coding agents, MCP, локальные модели и т.д. Но насколько реально собрать из этого действительно полезного автономного помощника, который большую часть работы выполняет без облачных API?

Интересует именно практический вариант:

Linux на обычном домашнем ПК; локальная LLM; агент, который умеет работать с файлами и запускать команды; MCP для подключения дополнительных инструментов; желательно без отправки данных во внешние сервисы.

Например, чтобы можно было сказать:

«Посмотри этот проект, найди причину ошибки, внеси исправление, запусти тесты и покажи, что изменилось».

И всё это происходило локально.

У кого-нибудь уже есть подобная конфигурация, которой реально можно пользоваться каждый день?

Интересно узнать:

какое железо используется; какую модель запускаете; какой агент (OpenCode, Aider, Cline, OpenHands, Pi и т.п.); какие MCP-серверы подключены; где локальный вариант всё ещё проигрывает облачным моделям.

Особенно интересно услышать опыт тех, кто полностью отключал облачные API и какое-то время работал только с локальными моделями.

Гоняю локального квена 3.8 27b в Q4_K_M на хомяке с 3090. Остановился на opencode в качестве харнесса, но из за UI, по интеллекту различий с остальными не заметил, везде примерно одинаково.

В 2026 ситуация с локальными моделями стала гораздо лучше, 70 процентов кодинг задач маленький квен спокойно закрывает. В качестве старшей модели для того на что qwen не хватает, Kimi K3 по подписке за 40$ (можно официально оплатить картами Мир). Единственное в чем локалкам ещё очень далеко до облачных моделей это контекст, тут ограничение хардвеерное, ниче не поделаешь.

anonymous
()

Недавно вышел замечательный ролик:

Я СОБРАЛ ПК ИЗ 4 TESLA V100 — ЗАЧЕМ?! | NVLink | 64Gb vs 128Gb vs 2x3090 | Большой тест
https://www.youtube.com/watch?v=Yel0Msi1lTY

Вся эта богодельня с платами 2017 года на 64Gb обошлась порядка 200 тыс. руб. Подходит только для инференса на 27-28 млрд. параметров, не все форматы сетей понимает. Смысл имеет только для запуска текстовых моделей, генерация картинок и видео/аудио работает медленно, и их проще делать на нескольких RTX 3060 с 24Gb видеоозу.

Xintrea ★★★★★
()
Ответ на: комментарий от Xintrea

Там одна только плата для GPU с PLX под сотню стоит, да и чтобы сами карты завести надо собирать/ставить старые nvidia драйвера и ядра, а через условные несколько лет возможно ещё начнутся проблемы с самими движками которые ИИ запускают т.к. постоянно поддерживать старые железки ни кто не будет.
Такое себе приключение.

За те-же условные 200к можно на авито поискать cmp170hx уже проверенную для unlock и может даже останется на всякую обвязку

Flotsky ★★★
()
Ответ на: комментарий от Flotsky

cmp170hx

Лотерея с памятью: Поскольку карты собирались из чипов, не прошедших проверку для A100, часть памяти может быть дефектной. Стабильная работа часто возможна только на 32–40 ГБ, а не на заявленных 64–80 ГБ.

Такая себе лотерея за 200 тыщ.

Xintrea ★★★★★
()
Последнее исправление: Xintrea (всего исправлений: 1)

Ещё хотелось бы узнать, как именно это сделать. Нет, конечно я спрашивал у облачных сервисов, и они даже делали мне пошаговую инструкцию. Но проблема с ними в том, что в какой-то момент по данной инструкции надо либо запустить скрипт из интернета, который сам что-то качает и устанавливает, либо pip install с зависимостями на 15 гигабайт, либо еще что-то в этом роде.
На такие жертвы я идти не готов, такой вариант меня не устраивает. Хочу как раньше: скачал тарболы по списку, дальше интернет отключается и установка и эксплуатация происходят полностью автономно от Интернета.

Khnazile ★★★★★
()
Ответ на: комментарий от Xintrea

Смысл имеет только для запуска текстовых моделей, генерация картинок и видео/аудио работает медленно, и их проще делать на нескольких RTX 3060 с 24Gb видеоозу.

позвольте не согласиться в разрезе картинок. Картинки можно на тапке генерировать. Нормально генерировать уже на 8Гб видеокарте получается.

tiinn ★★★★★
()
Ответ на: комментарий от Khnazile

На такие жертвы я идти не готов

а придётся. Вот, когда ИИ-шечку вам платно будут корпорасты продавать, такая возможность будет. А за халяву придётся потрахаться.

tiinn ★★★★★
()
Ответ на: комментарий от Khnazile

Так это не агент а просто чатик получится.

Но, в сущности, модель-то используется одна.

gruy ★★★★★
()

Ежедневно гоняю qwen3.8-flash-next на своей Strix Halo 128GB VRAM (Minisforum MS-S1 Max), в качестве харнеса pi

инструкции по запуску тут https://strix-halo-toolboxes.com/

по цифрам pp уровне 900-1200 т.с. tg 35-45 т.с. окно контекста до 500к но я больше 250к не поднимался.

задачи средней руки за 1-2ч делает, мелочь всякую и исследования 5-15м может хавать. В целом достаточно шустро для 125B + 50B энграмм. Я очень доволен.

это заметно медленнее облачных, но зато «бесплатно» (нет) и не зависишь от впнов и блоков акаунтов. В идеале конечно использовать как «младшую» модель в стеке (что я и практикую), но она достаточно хороша что бы делать от и до при хорошей постановке задачи.

Noob_Linux ★★★★
()
Последнее исправление: Noob_Linux (всего исправлений: 1)
Ответ на: комментарий от Khnazile

С чего бы корпорациям продавать мне локальную ИИшечку, когда продавать подписку на облачную гораздо перспективнее для ихнего бизнеса?

потому что среди богатых толстопузов появился спрос на локальную ИИшечку. Конфиденциальность же ж.

tiinn ★★★★★
()
Ответ на: комментарий от pinachet

Мне нельзя на швабр ходить, на ЛОРе засмеют же! Перед анонимусом стыдно будет!

Khnazile ★★★★★
()
Ответ на: комментарий от pinachet

Ну я сначала купил две карты за 112 000 рублей, но внезапно оказалось, что моя материнская плата не умеет в две видеокарты, хотя на ней есть два полноразмерных PCI-E. Гуглеж показал, что с двумя видюхами параллельно на полной скорости могут работать далеко не все платы. Подходящих материнок под свой AM4 я не нашел, либо нашел, но БУ и в непонятном состоянии. Собрал машину на AM5 и DDR5 за 170 000, половину из которых составила память 64GB и почти столько же материнка ASUS ProArt X870E-Creator WiFi

r0ck3r ★★★★★
()
Ответ на: комментарий от r0ck3r

Странно, у меня на одной cmp50hx получается ~26 t/s и ~40 с MTP, но мало vram для контекста остаётся

Запускаю так # llama-server --host 0.0.0.0 --port 8000 -m ./Qwen3.8-27B-TTURBO-Fable-C-Fusion-709-L-Uncen-NM-DAU-NEO-MTP-IQ4_NL.gguf --jinja --chat-template-file ./chat_template-tturbo.jinja --temp 0.6 --top-p 0.95 --mi n-p 0.0 --repeat-penalty 1.00 -np 1 --load-mode none -c 20000 -fa on --reasoning-preserve --spec-type draft-mtp --spec-draft-n-max 2

Ожидал что 2 более новые GPU будут хотябы на уровне 50 t/s

Flotsky ★★★
()
Ответ на: комментарий от Flotsky

К сожалению не могу ничего сказать. Я запускаю через vLLM так:

docker run --rm --name vllm --gpus all   -e NCCL_P2P_DISABLE=1 -e NCCL_IB_DISABLE=1   -v /mnt/ssd/huggingface:/root/.cache/huggingface   -p 8000:8000 --ipc=host vllm/vllm-openai:latest   --model cyankiwi/Qwen3.8-27B-AWQ-INT4   --tensor-parallel-size 2   --quantization compressed-tensors   --max-model-len 131072   --gpu-memory-utilization 0.90   --kv-cache-dtype fp8   --enable-prefix-caching   --max-num-seqs 1   --host 0.0.0.0   --served-model-name qwen3-coder   --enable-auto-tool-choice   --tool-call-parser qwen3_coder

и оно работает. Может быть с llama-server будет быстрее - нужно ковырять, а у меня пока времени на это не очень много. А с другой стороны 5060 это совсем не топовые карты. Моя предыдущая 3070 TI 8Gb была по субъективным ощущениям быстрее в некоторых в играх, просто памяти было мало

r0ck3r ★★★★★
()
  • Markdown
Пустая строка (два раза Enter) начинает новый абзац. Знак '>' в начале абзаца выделяет абзац курсивом цитирования.
Внимание: прочитайте описание разметки Markdown.
Используйте Ctrl-Enter для размещения комментария