LINUX.ORG.RU
Форум — Talks  

Никто не знает, сколько $ нейросеть потратит на конкретную задачу

 , , , ,


0

3

Сабдж


Разработчики ИИ призывают активнее внедрять новые технологии в бизнес-процессы, но проблема в том, что бизнес нередко не может предугадать, сколько именно денег будет потрачено на решение той или иной задачи силами ИИ. В этом уравнении слишком много переменных, чтобы корпоративные пользователи могли достоверно планировать свой бюджет.

…

В допуск от 11 до 25 % превышения первоначального бюджета на ИИ уложились 39 % респондентов, ещё 35 % попали в более широкий диапазон превышения от 26 до 50 %, а вот «промахнулись» на 50 % только 13 % опрошенных. Правда, 2 % респондентов при этом отметили, что вообще не прогнозировали расходы данного вида.

Практическое исследование группы американских учёных и представителей Microsoft Research, которое охватило 6800 различных заданий, выявило высокую степень непредсказуемости результатов работы с ИИ-моделями с точки зрения расходования токенов,

…

Если более «дешёвая» ИИ-модель применяется для задач, под которые она не оптимизирована, расходы могут превысить вариант обращения к более дорогой и эффективной модели. Исследование показало, что такой перекос наблюдается в 32 % случаев. Соответственно, расценки на использование ИИ-моделей сами по себе не могут служить адекватными входными данными для расчёта общих расходов на решение задачи.

На страницах The Wall Street Journal приводится пример с обработкой одного и того же запроса с помощью двух различных моделей Google: более «тяжеловесной» Gemini 3.1 Pro и более доступной и скоростной Gemini 3 Flash. Если первой удалось обработать запрос за 85 шагов, то вторая потратила на это почти 1000 шагов и после этого всё равно не справилась. Затраты в первом случае ограничились $1, а во втором выросли до $14 и фактически не обеспечили желаемого результата.

…

Представители Google пояснили, что подобная вариативность свойственна системам ИИ, и общие расходы на их применение зависят от множества разных факторов. Предсказать точную сумму затрат в столь новой сфере порой весьма затруднительно. Google пытается сгладить колебания расходов, устанавливая ограничители и предлагая различные тарифные варианты. Сотрудников компаний для лучшей предсказуемости расходов на использование ИИ тоже надо обучать наиболее эффективным приёмам работы с такими системами.


Немного предсказуемо, ага.

А смысл обучать сотрудников компаний, если 1) сам гугол запросто может сбросить вас на более легковесную модель, ничего не сказав, 2) новые модели от гугла выходять где-то раз в три месяца. Сотрудников каждые три месяца переобучать? И кто их должен обучать? Гугол?

Перемещено dataman из ai

★★★★★

Последнее исправление: dataman (всего исправлений: 1)

никто не знает

Надо просто спросить у ИИ.

И вообще, зачем задачи люди ставят? Пусть задачи тоже ставит ИИ. Тогда это будет его проблема.

i-rinat ★★★★★
()

«никто не знает, сколько $ нейросеть потратит на конкретную задачу»

Да так и есть.

GLM 5.3 может запросто всадить в несколько раз больше токенов на задачу, которую GPT-6.1 Sol решает быстро и без усилий. И хотя цена на GLM 5.3 примерно в 2-3 раза ниже, расходы будут выше.

wandrien ★★★★
()

Ну, с людьми, в общем-то, тоже никто не знает. Сроки выполнения работ (а следовательно и бюджеты) - вещь вообще очень приблизительная.

Beewek ★★★★
()

Новый раздел форума: «Искусственный Интеллект»:

Группа относится к техническому форуму и в нее подходят любые технические обсуждения применения ИИ. Нетехнические обсуждения более уместны в «Talks»; теоретические вопросы общего характера – в «Science & Engineering».

dataman ★★★★★
()

А за «сабдж» в следующий раз буду сносить, достал.

dataman ★★★★★
()

Как будто кто-то знает, сколько времени человек потратит на какую-либо задачу. Оценки сроков в ойтишечке – что гадание на фекальной гуще.

yorshka
()

Это конечно ужасно и очень страшно, но кто-нибудь знает, сколько денег потратят кожаные мешки на конкретную задачу? В какое превышение уложатся? Как нанять более продвинутую модель и как избавиться от устаревшей или неэффективной?

aiqu6Ait ★★★★★
()
Ответ на: комментарий от aiqu6Ait

Видимо их это беспокоит, потому что нейросеть может сожрать весь месячный бюджет за день. С человеками проще, потому что зп-шечка как правило фиксирована. То что непонятно сколько месяцев нужно будет платить эту зпшечку - как бы разговор немного другого плана.

unDEFER ★★★★★
()
Ответ на: комментарий от Beewek

Ну, с людьми, в общем-то, тоже никто не знает.

Но, с людьми хотя бы известно, сколько з/п жрёт этот сотрудник в месяц. А сроки, да, только приблизительно понятны.

tiinn ★★★★★
() автор топика

Ну... экстраполируй из опытов ;)

slackwarrior ★★★★★
()

сам гугол запросто может сбросить вас на более легковесную модель, ничего не сказав

Пруфы будут или набросал сам?

Gary ★★★★★
()

Тю, попробуй сначала предугадать сколько денег уйдет на ремонт в доме/квартире

cobold ★★★★★
()
Ответ на: комментарий от yorshka

Как будто кто-то знает, сколько времени человек потратит на какую-либо задачу.

Точность не всегда нужна, плюс желательно знание оценки конкретных индивидов.

anc ★★★★★
()
Ответ на: комментарий от cobold

Да, тема та ещё… как не считай, а улетит куда как больше.

anc ★★★★★
()
Ответ на: комментарий от yorshka

Вам что-то непонятно в выражении «точность не всегда нужна»?

anc ★★★★★
()
Ответ на: комментарий от tiinn

По первой ссылке - изменение настроек reasoning effort в claude code по умолчанию, это не подмена модели. По второй ссылке - удорожание подписок, «новая модель хуже старой» - это не тоже самое что тайком подложить другую модель.

Укажи четко где именно речь про сброс на более легковесную модель.

Gary ★★★★★
()

Да я пытался, поставить себе на комп, какую модель. Нифига не вышло в итоге, даже самая отсталая модель отказалась работать. Памяти, говорит, мало. Ну нищеброд, чё тут сделаешь, ёлы!? У меня всего 4 гига RAM и 2 VRAM. Нехватат. Надо как минимум 8, и того и другого...

cadaber ★★
()
Ответ на: комментарий от cadaber

Да я пытался, поставить себе на комп, какую модель.

…

У меня всего 4 гига RAM и 2 VRAM

Никуда не торопитесь?

anc ★★★★★
()
Ответ на: комментарий от cadaber

У меня всего 4 гига RAM и 2 VRAM.

Это конечно мало, но попробуй запустить заквантованные 1.5B и менее модели. Например, Qwen2.5-1.5B-Instruct-Q4_K_M-GGUF

https://huggingface.co/gabriben/Qwen2.5-1.5B-Instruct-Q4_K_M-GGUF

https://huggingface.co/enacimie/Qwen2.5-1.5B-Instruct-Q4_K_M-GGUF

По ссылкам есть краткие описания и как их запустить.

Есть даже 0.5B варианты.

А вообще, да, чем больше RAM и VRAM тем лучше.

anonymous_incognito ★★★★★
()
Ответ на: комментарий от cadaber

Да я пытался, поставить себе на комп, какую модель. Нифига не вышло в итоге, даже самая отсталая модель отказалась работать. Памяти, говорит, мало. Ну нищеброд, чё тут сделаешь, ёлы!? У меня всего 4 гига RAM и 2 VRAM. Нехватат. Надо как минимум 8, и того и другого…

Вы новости, безусловно, читаете и радио слушаете. Вы должны знать, что модели сильно чувствительны к размеру памяти, банально модель должна влезть. Просто параметры модели умноженные на размер одного параметра (2 или 4 байта, редко 1 байт) даёт вам примерные минимальные требования. Ну а то, что качество 35B моделей вызывает вопросы тоже не секрет.

VIT ★★★
()
Ответ на: комментарий от VIT

Просто параметры модели умноженные на размер одного параметра (2 или 4 байта, редко 1 байт) даёт вам примерные минимальные требования.

Сейчас есть квантованные модели с 4 битами (не байтами) на параметр, 2-мя битами и даже 1.58 бита, дробное число получается для трёх состояний: {-1, 0, 1} https://arxiv.org/html/2402.17764v1 и даже как ни странно не очень сильно метрики падают. 4 байта и даже 2 байта слишком накладно выходит.

К этим требованиям ещё надо добавить расход на размер контекста.

anonymous_incognito ★★★★★
()
Ответ на: комментарий от anonymous_incognito

Да, я слежу за типами данных. Для первичной оценки вполне достаточно и 2 байт. А эти специальные форматы используются после рубина и блэквела, ну ещё в TPU. Так что для ТС неактуально.

VIT ★★★
()
Ответ на: комментарий от anc

Никуда не торопитесь?

Да нет, вобщем-то. HL-2 нативный, все 4+1, на виндовом разделе Fallout-3 +New Vegas на максималках... Грех жаловаться, как говорится. Но, человеки так устроены, что всегда хочется чего-то большего, чем есть в наличии. Я например, хочу приобрести ещё 4-8 гигов DDR4 для своей платы, но пока напряжно, чисто финансово.

cadaber ★★
()
Ответ на: комментарий от cadaber

Я например, хочу приобрести ещё 4-8 гигов DDR4 для своей платы, но пока напряжно, чисто финансово.

Финансово понимаю, но ближе к концу 2026 покупать 4-8 гигов имхо не айс.

anc ★★★★★
()
Ответ на: комментарий от Gary

По первой ссылке - изменение настроек reasoning effort в claude code по умолчанию

Хорошо, пусть это называется «изменение настроек reasoning effort в claude code по умолчанию», это не отменяет того, что учи персонал, не учи, на той стороне что-то подкрутят, и ваши задачи решаться перестанут. Придётся персонал учить заново. Пусть даже вас не скинут на другую модель.

tiinn ★★★★★
() автор топика
Ответ на: комментарий от dataman

я б не сказал, что обсуждение нетехническое, если уж мы докатились до терминов «изменение настроек reasoning effort в claude code по умолчанию»

tiinn ★★★★★
() автор топика
Ответ на: комментарий от tiinn

Действительно говорят, злоупотребление языковыми моделями плохо влияет на людей.

Ты серьёзно? Из-за того чтоб обновилась одна программа и у неё поменялся дефолт, надо учить персонал заново? Не проще поменять настройку на ту какую хочется?

Готов в вашей конторе быть специальным человеком за 400’000 руб/мес, который будет приходить раз в месяц и спрашивать у нейронки «мы обновили claude code, стало хуже работать, что поменялось?»

Gary ★★★★★
()
Ответ на: комментарий от tiinn

если уж мы докатились до терминов

Что предлагаешь, перемещать топики по N раз в день, в зависимости от комментариев?

dataman ★★★★★
()
Ответ на: комментарий от aiqu6Ait

кто-нибудь знает, сколько денег потратят кожаные мешки на конкретную задачу?

Епта, да сколько дашь, столько и потратят. Тоже мне загадка.

thesis ★★★★★
()
Ответ на: комментарий от VIT

А эти специальные форматы используются после рубина и блэквела, ну ещё в TPU.

Они даже просто на CPU используются, хотя для полутора бит крайне желательно иметь хотя бы AVX2, чего подозреваю у него нет. Но 4-х и 2-х битное квантование вполне можно задействовать. Ну тормозить оно будет сильно, скорее всего несколько секунд на один токен, но если очень хочется запустить у себя всё-таки хоть какую LLM, то пойдёт.

Я тут нашёл на гитхабе проект, позволяющий запустить полноценную Kimi K3 со всеми параметрами даже на 8 Gb RAM. https://github.com/FareedKhan-dev/kimi-k3-in-c

A 2.78-trillion-parameter Kimi K3 running inference on a single CPU in 8.24 GB of RAM. Portable C99: no BLAS, no framework, no GPU.

Со скоростью ~ 26 сек. на токен. И 5 сек. если есть 128 Gb RAM. Думаю попробовать, но пока отдельная история это даже просто суметь выкачать 1.5 Tb данных с весами модели.

Конечно с такими скоростями - это скорее просто игрушка, чем полезный инструмент, но всё-равно круто.

anonymous_incognito ★★★★★
()
Ответ на: комментарий от dataman

Что предлагаешь, перемещать топики по N раз в день, в зависимости от комментариев?

Фичреквест с аналогом ln -s для топиков :)

anonymous_incognito ★★★★★
()
Ответ на: комментарий от sabacs

Если есть задачи, где ждать ответ модели часами и сутками приемлемо, то уже не просто игрушка. Для агентного кодирования или RAG, наверное, не годится =)

anonymous_incognito ★★★★★
()
Ответ на: комментарий от sabacs

Посчитал для 20 тысяч токенов:

(20000 * 26) / (60 * 60 * 24) = 6.0185185185185
wandrien ★★★★
()
Ответ на: комментарий от sabacs

Откуда годы? Без учёта prefill, но если например, для ответа модель на круг потратит 20k токенов, ответ будет примерно через неделю. Хотя тут ещё есть риски, что у SSD ресурс быстро закончится...

anonymous_incognito ★★★★★
()
Ответ на: комментарий от anonymous_incognito

Наблюдая за тем, что происходит вокруг онлайн моделей и их провайдеров не трудно предположить, что роль локальных моделей в ближайшее будущее будет возрастать. Их качество будет расти, а размер нет. Скорее всего установится некий минимальный джентльменский набор железо-модель начального уровня на 8-12GB DRAM, среднего уровня для повседневной работы 32-48GB DRAM, это будет приемлемая и комфортная работа примерно эквивалентная сегодняшним опусам 5.5, и так-сказать фронтьер модели с 64+GB DRAM, примерно предоставляющее всё лучшее и быстрое.

Зависеть от онлайн провайдера бизнес позволить себе не может, а отказаться от использования - явно проиграть конкурентам по скорости и эффективности разработки. А то, что размеры моделей раздуты необоснованно уже более-менее понятно.

VIT ★★★
()
Ответ на: комментарий от Gary

Из-за того чтоб обновилась одна программа и у неё поменялся дефолт, надо учить персонал заново? Не проще поменять настройку на ту какую хочется?

А как поменять настройку? Настройка в руках гугла.

tiinn ★★★★★
() автор топика
Ответ на: комментарий от dataman

Что предлагаешь, перемещать топики по N раз в день, в зависимости от комментариев?

Может, просто не спешить?

tiinn ★★★★★
() автор топика
Ответ на: комментарий от sabacs

Полгода назад Южная Корея подвела итог третьему этапу конкурса на создание национальной языковой модели. Там третье место взяла очень маленькая, но амбициозная фирма. Конкурс, конечно, выиграл «кто надо», но возможности, там показанные впечатляют. Не думаю, что занижаю.

VIT ★★★
()
Ответ на: комментарий от VIT

Не видел пока что модели размером меньше 100B, которая бы адекватно работала в кодинге и агентном цикле.

Проблема не в том, что модели специально раздуты, а в том, что пока никто не знает, как сделать меньше.

Постепенно допилят.

wandrien ★★★★
()

Не забывайте, что есть еще бесплатный сегмент
Я могу с дипсиком месяц разрабатывать какую-то алгоритмическую модель
Периодически там заканчивается чат, дипсик такой - ой, извините, токены кончились
Я тут же открываю новый чат, и задача продолжается как ни в чем не бывало
И так несколько раз
И это все бесплатно !
При этом перелопачивается куча навороченного многопоточного кода, алгоритм приобретает угрожающие размеры и его сложность может экспоненциально увеличиваться
И когда утром на следующий день я открываю чат, я жду, что он мне скажет - все, дорогой, токенов больше нет, электричество кончилось

kto_tama ★★★★★
()
Вы не можете добавлять комментарии в эту тему: только для зарегистрированных, score>=50.