Дипсик пишет, что оно в spinlock крутится, ожидая GPU. Гугл написал интереснее, но предложения уровня «ограничить ядра» звучат сомнительно, мечтается сделать красиво – т.е. перейти с pull на push модель. Да и кто этим гуглам верит. Может, тут народ уже сталкивался?
// llama.cpp предлагать только с конкретным рецептом фикса проблемы: меня пугает ОЧЕНЬ большое количество «крутилок», я хочу кнопку «сделать п@#дато». Иначе нахрена мне ИИ, если не для того, чтобы ЕИ не включать.
UPD: Solved.







