LINUX.ORG.RU

Посоветуйте uncensored model для CPU zen 5

 , , uncensored,


0

1

Коллеги , посоветуйте UNCENSORED модель для сервака с CPU zen 5

processor       : 191
vendor_id       : AuthenticAMD
cpu family      : 26
model           : 2
model name      : AMD EPYC 9475F 48-Core Processor
stepping        : 1
microcode       : 0xb002161
cpu MHz         : 2496.374
cache size      : 1024 KB
physical id     : 1
siblings        : 96
core id         : 45
cpu cores       : 48
apicid          : 219
initial apicid  : 219
fpu             : yes
fpu_exception   : yes
cpuid level     : 16
wp              : yes
flags           : fpu vme de pse tsc msr pae mce cx8 apic sep mtrr pge mca cmov pat pse36 clflush mmx fxsr sse sse2 ht syscall nx mmxext fxsr_opt pdpe1gb rdtscp lm c
onstant_tsc rep_good amd_lbr_v2 nopl xtopology nonstop_tsc cpuid extd_apicid aperfmperf rapl pni pclmulqdq monitor ssse3 fma cx16 pcid sse4_1 sse4_2 x2apic movbe popcnt aes xsave avx f16c rdrand lahf_lm cmp_legacy svm extapic cr8_legacy abm sse4a misalignsse 3dnowprefetch osvw ibs skinit wdt tce topoext perfctr_core perfctr_nb bpext perfctr_llc mwaitx cpuid_fault cpb cat_l3 cdp_l3 hw_pstate ssbd mba perfmon_v2 ibrs ibpb stibp ibrs_enhanced vmmcall fsgsbase tsc_adjust bmi1 avx2 smep bmi2 erms invpcid cqm rdt_a avx512f avx512dq rdseed adx smap avx512ifma clflushopt clwb avx512cd sha_ni avx512bw avx512vl xsaveopt xsavec xgetbv1 xsaves cqm_llc cqm_occup_llc cqm_mbm_total cqm_mbm_local user_shstk avx_vnni avx512_bf16 clzero irperf xsaveerptr rdpru wbnoinvd amd_ppin cppc arat npt lbrv svm_lock nrip_save tsc_scale vmcb_clean flushbyasid decodeassists pausefilter pfthreshold avic v_vmsave_vmload vgif x2avic v_spec_ctrl vnmi avx512vbmi umip pku ospke avx512_vbmi2 gfni vaes vpclmulqdq avx512_vnni avx512_bitalg avx512_vpopcntdq la57 rdpid bus_lock_detect movdiri movdir64b overflow_recov succor smca fsrm avx512_vp2intersect flush_l1d debug_swap amd_lbr_pmc_freeze
bugs            : sysret_ss_attrs spectre_v1 spectre_v2 spec_store_bypass srso spectre_v2_user vmscape
bogomips        : 7283.17
TLB size        : 192 4K pages
clflush size    : 64
cache_alignment : 64
address sizes   : 52 bits physical, 57 bits virtual
power management: ts ttp tm hwpstate cpb eff_freq_ro [13] [14]

Памяти 1 террабайт . Скорость нужна средняя

★★★★★

Идешь на hugging face, регаешься, забиваешь в профиль свое железо, идешь в поиск по моделям, там пишешь что нить про obliterated и ставишь фильтр по железу

cobold ★★★★★
()

gemma4-e2b. Будет замечтательно работать.

Не, а что ты хотел? Ни задач, ни характеристик железа. Особенно «скорость средняя» это что? Чисто субъективщина. Качай lmstudio и пробуй, там и поиск удобный есть. Агась. Если у тебя эпики с терабайтом оперативки - ну… Можешь в общем-то теоретически модели на 70-120b запускать, даже с относительно «приемлемой» скоростью. Только в режиме диалога, ни о каком агентском использовании без видимокарты речи идти не может (за исключением каких-нибудь 35b-a3b или подобного.

anonymous
()
Ответ на: комментарий от pinachet

Например с чем вы сталкивались и на каких моделях? Просто насколько я понимаю как эту цензуру оттуда выковыривают, то поисходит это неочень «органично» так сказать, в результате чего как раз модель может стать «тупее».

Bad_ptr ★★★★★
()
Последнее исправление: Bad_ptr (всего исправлений: 1)
Ответ на: комментарий от Bad_ptr

Типа проскань сетку , сделай что то системное . На моделях deepseel , glm , claude

pinachet ★★★★★
() автор топика
Ответ на: комментарий от pinachet

Типа проскань сетку , сделай что то системное . На моделях deepseel , glm , claude

попробуйте поднять на вашей конфигурации вот эту модель (любым доступным вам способом), и скажите какой decode и prefill t/s получились:

https://huggingface.co/llmfan46/Qwen3.6-35B-A3B-uncensored-heretic

от полученных цифр можно будет дальше «танцевать»

gagarin0
()
Последнее исправление: gagarin0 (всего исправлений: 1)
Ответ на: комментарий от gagarin0

Qwen3.6-35B-A3B-uncensored-heretic

  • generation 32.8 token/s
  • prompt processing 128.30

То что я пытаюсь юзать huihui_ai/qwen3-abliterated:30b-a3b-40k (30B-A3B MoE) [просто она на сколько хуже? ]

  • 52.4 tok/s
  • 209.0 tok/s

промт для теста стандартный Write a haiku about linux.

pinachet ★★★★★
() автор топика
Ответ на: комментарий от pinachet

decode t/s хороший, правда prompt processing конечно грустный.

из этих двух, попробуйте на своих задачах именно Qwen3.6-35-a3b, она по сравнению с qwen3-abliterated:30b-a3b-40k поумнее.

кстати контекст какой выставили, 32k? и через что поднимали, llama-cpp?

На моделях deepseek , glm , claude

про это пока забудьте, без GPU вы получите 3-5 t/s и еще хуже prefill, задачи будут длиться буквально днями

P.S. и начните использовать для локальных моделей агент pi.dev он из коробки не мудрит с контекстом как это делает opencode и hermes (вроде бы), а это особенно важно при вашем грустном prompt processing

gagarin0
()
Последнее исправление: gagarin0 (всего исправлений: 3)
Ответ на: комментарий от gagarin0

pi.dev и юзаю.На этой модели дает ошибку ( это мол шаблон не верный ) ?

time=2026-08-31T02:57:02.634Z level=ERROR source=routes.go:2962 msg="chat template prompt error" error="{\"error\":{\"code\":500,\"message\":\"\\n------------\\nWhile executing CallExpression at line 198, column 32 in source:\\n...ant\\\") %}↵            {{- raise_exception('A tool message must follow an assistan...\\n                                           ^\\nError: Jinja Exception: A tool message must follow an assistant or tool message.\",\"type\":\"server_error\"}}"

да контекст 32к через llama

pinachet ★★★★★
() автор топика
Ответ на: комментарий от pinachet

там помоему трабла была то что одно юзало jinja темплейт а другое на осное go template , вроде фиксанул

pinachet ★★★★★
() автор топика
Ответ на: комментарий от pinachet

AMD EPYC 9475F
но там несчитая пиков нагрузки он будет более менее свободен.

Будь осторожен он 400 Ватт жрет. Как только такое питают и охлаждают...

superuser ★★★★☆
()
Ответ на: комментарий от superuser

Как только такое питают и охлаждают...

Ну он же его охлаждать не голой жопой будет )
Да и 400Вт - всё ещё не киловаттный XEON W в масле.

GAMer ★★★★★
()
Ответ на: комментарий от gagarin0

и начните использовать для локальных моделей агент pi.dev он из коробки не мудрит с контекстом как это делает opencode

А как мудрит opencode? Я его подозревал в чём-то таком (после промпта долгое время непонятно что происходит), но не был уверен.

Beewek ★★★★
()
Ответ на: комментарий от Beewek

opencode из коробки ОЧЕНЬ сильно мудрит с контекстом, переделывает его что вызывает prompt eval на стороне LLM. opencode заточен изначально на облачные LLM, где эти «хитрости» не заметны, его для локального использования нужно адаптировать, я забил, и исплоьзую pi.dev который работает без всяких подкапотных хитростей

gagarin0
()
Ответ на: комментарий от gagarin0

Отсутствие у pi.dev субагентов и plan mode довольно сильно смущает. Ну и инсталлятор через curl -fsSL https://pi.dev/install.sh | sh тоже как-то страшновато. Хотя у opencode вроде тоже такой:)

Beewek ★★★★
()
Ответ на: комментарий от Beewek

Отсутствие у pi.dev субагентов

https://github.com/nicobailon/pi-subagents

plan mode <-> build mode

это как раз тот момент когда opencode «переделывает» context

https://github.com/narumiruna/pi-extensions

gagarin0
()
Последнее исправление: gagarin0 (всего исправлений: 1)
Ответ на: комментарий от pinachet

Понятное дело что это не мой сервак и скоро пойдет на другое , но там несчитая пиков нагрузки он будет более менее свободен.

Воткните в него любую видеокарту название которой образовано от слова RTX или Tesla. И чтобы там было 16гб. Проблему решит с prefill.

EvilSpirit
()
Ответ на: комментарий от pinachet

А что тут подсказывать, когда это и есть максимум для указанной модели на этом железе? Упор все равно в скорость памяти, а у тебя ещё там NUMA. Быстрее не будет, уж извини. Ну или ищи модели с меньшим числом параметров. Те же Qwen.

anonymous
()
Ответ на: комментарий от anonymous

NUMA эффект убрал давно , привязав через cpuset пришло ускорение ( cpuset )

pinachet ★★★★★
() автор топика
Ответ на: комментарий от pinachet

oLlama/orcarouter/Qwen3.8-27B-Uncensored: latest дает 30-40 token/s

Это очень недурно, если на CPU и на генерацию. Одна 3090 без mtp на llama.cpp дает приблизительно столько же. Кстати на vllm скорость больше, но я не в курсе как она на CPU работает, хотя бэк для CPU там вроде есть.

einhander ★★★★★
()
Ответ на: комментарий от pinachet

Твой ethernet должен иметь скорость как pci5 тогда подобное имеет смысл хоть какой-то. Даже несколько видеокарт если они не соединены nvlink работают достаточно медленно, а ты хочешь использовать интерфейс на несколько порядков медленнее.

Вообще продаются сборки на 4х v100 с 32гб памяти в каждой на nvlink, общим обьемом 128гб, за относительно вменяемые деньги типа 300к. По замерам эта сборка в пару раз лучше чем пара 3090 без nvlink.

einhander ★★★★★
()
Последнее исправление: einhander (всего исправлений: 2)
  • Markdown
Пустая строка (два раза Enter) начинает новый абзац. Знак '>' в начале абзаца выделяет абзац курсивом цитирования.
Внимание: прочитайте описание разметки Markdown.
Используйте Ctrl-Enter для размещения комментария