LINUX.ORG.RU

Речевой ввод

 , ,


1

1

Увидел рекламу от Сбера программы для речевого ввода. Она с телеметрией, хотя они заявляют, что не собирают собственно сам текст, но кто же им поверит. А есть ли решения для действительно приватной расшифровки речи? Интересует русский язык.

★★★★★

тут сразу нужно уточнение. тебе локальную систему распознавания речевого ввода или клиент для серверного распознавания ??
ибо локальная система распознавания речи требует ресурсов на обработку, но ничего налево не уходит.
а колонки с алисой марусей салютом и прочий тыгыдым шлют аудиопоток на сервер и получают от него готовые инструкции. уход твоих данных на сторону уже включен в систему.

pfg ★★★★★
()
Последнее исправление: pfg (всего исправлений: 1)

whisper, или подобное.
они как правило мультиязычные.

etwrq ★★★★★
()

Использовал vosk для расшифровки видеозаписи предзащиты. Не без ляпов, но получилось неплохо.

anonymous
()

Я себе ставил локалхостный Vosk. Это был тот ещё геморрой. Пришлось преобразовать файл в моноканальный и менять частоту дискретизации на 16 кГц (могу соврать), потому что так оно лучше воспринимало аудиопоток и «лучше» распознавало речь.

PunkPerson ★★
()
Ответ на: комментарий от PunkPerson

Оригинальный whisper, который от OpenAI, а не модификации, не требует специальных конвертаций и довольно всеяден: ему можно подавать и mp3 и mkv на вход и кучу других форматов.

Впрочем, для практических целей не так сложно сделать скрипт с ffmpeg, который выбирает аудиодорожку и конвертирует ее.

praseodim ★★★★★
()
Последнее исправление: praseodim (всего исправлений: 1)

Я себе поставил whisper-cpp и hyprwhisper-rs, вынес кнопку на панель и теперь могу нажимать кнопку, говорить, нажимать ещё раз и всё сказанное преобразуется в текст в активное поле ввода(ну или в буфер обмена). Модель используется ggml-large-v3.bin.

Вот это ввёл голосом:

Вот сейчас этот текст в сообщение ввожу голосовым голосом. Работает, в принципе, неплохо.

Единственное, что-то пока не осилил, чтобы работало по упушту толк. Работает только по нажатию и по следующему отжатию. Проблема не в распознавании, проблема в настройке комбинации клавиш в High Blender.

по упушту толк - по push-to-talk.

High Blender - Hyprland.

Но надо иметь в виду, что у меня микрофон лежит где-то под монитором и промпт у меня с русским языком на первом месте. Также не уверен в своём английском произношении.

В итоге, благодаря этому ответу, добил PTT. Теперь вообще удобно стало.

И да, забыл упомянуть, на 4070Ti с использованием CUDA, модель large работает без существенных(напрягающих) задержек, 1-2 секунды и наговоренный текст в поле ввода.

Loki13 ★★★★★
()
Последнее исправление: Loki13 (всего исправлений: 3)
Ответ на: комментарий от Loki13

Да, здесь-то и засада, у меня локальные мощности маленькие, есть какая-то карточка на ноуте, но она хронически отключена, ибо падает периодически от нагрузки. Да и хост-ос у меня сейчас вообще офтопик - мой комп слишком старый и новые линуксы на него не встают. Похоже, вся эта штука не сработает.

den73 ★★★★★
() автор топика
Ответ на: комментарий от den73

У hyprwhisper-rs в настройках есть вот такое:

"groq": {
      "model": "whisper-large-v3-turbo",
      "endpoint": "https://api.groq.com/openai/v1/audio/transcriptions",
      "prompt": "Transcribe with proper capitalization, including sentence beginnings, proper nouns, titles, and standard English capitalization rules."
    },
    "gemini": {
      "model": "gemini-2.5-pro-exp-0827",
      "endpoint": "https://generativelanguage.googleapis.com/v1beta/models",
      "temperature": 0.0,
      "max_output_tokens": 1024,
      "prompt": "Transcribe with proper capitalization, including sentence beginnings, proper nouns, titles, and standard English capitalization rules."
    },
    "parakeet": {
      "model_dir": "models/parakeet/parakeet-tdt-0.6b-v3-onnx",
      "prompt": "Transcribe with proper capitalization, including sentence beginnings, proper nouns, titles, and standard English capitalization rules."
    },

Т.е. как я понимаю, можно и «облачную» модель использовать, а не локальную. Но я не пробовал, т.к. локальную тянет.

Loki13 ★★★★★
()
Ответ на: комментарий от den73

Да, здесь-то и засада, у меня локальные мощности маленькие

В Нейросети на C от создателя Redis есть qwen-asr. Но сам я ещё не пробовал. :)

https://github.com/antirez/qwen-asr#memory-requirements:

Static Footprint (Model Load)

These numbers come from the current implementation and model files:

  • Safetensors are memory-mapped.
  • Encoder BF16 weights are converted to F32 and kept in heap memory.
  • Decoder builds a fused gate/up matrix copy for faster decode.
Component0.6B1.7B
safetensors mmap files1.747 GiB4.376 GiB
encoder copied F32 weights0.694 GiB1.183 GiB
decoder extra heap (fused + norms)0.328 GiB1.313 GiB
static total (theoretical)2.770 GiB6.871 GiB

Measured Peak RSS (--silent)

Measured on Apple M3 Max using the current codebase:

Audio length0.6B -S 00.6B -S 201.7B -S 01.7B -S 20
10.000s2.695 GiB2.688 GiB6.573 GiB6.573 GiB
45.000s2.861 GiB2.757 GiB6.783 GiB6.700 GiB
88.890s3.173 GiB2.815 GiB7.113 GiB6.742 GiB
119.262s3.254 GiB2.789 GiB7.288 GiB6.706 GiB
dataman ★★★★★
()
Ответ на: комментарий от den73

Например - вышеупомянутая программа handy может использовать как модели whisper с выполнением на видео-карте, так и Parakeet V3 Model:

CPU-only operation - runs on a wide variety of hardware
Minimum: Intel Skylake (6th gen) or equivalent AMD processors
Performance: ~5x real-time speed on mid-range hardware (tested on i5)
Automatic language detection - no manual language selection required
sigurd ★★★★★
()
Ответ на: комментарий от praseodim

Whisper, Vosk - расшифровывают речь в звуковом … файле.

Whisper — есть несколько реализаций, работающих с микрофоном, но нужен GPU. Vosk и без GPU справляется. Не пробовал.

question4 ★★★★★
()
Ответ на: комментарий от sparkie

Dragon dictate. Английская версия «Горыныча», made in IBM.

IBM? Википедия пишет, что независимая компания, купленная MS в 2021-м с интеграцией в CoPilot.

Но да, они ещё в середине 1990-х на пиратских CD продавались.

А у IBM в OS/2 4 был какой-то голосовой ввод, но без поддержки русского языка.

question4 ★★★★★
()
Ответ на: комментарий от ya-betmen

С ней Саныч в поставке. Ну его.

ЗЫ

По теме всё не очень хорошо. У нас как бы есть LLM, но чёт их специально делают так, чтоб пользовать было дико не удобно.

peregrine ★★★★★
()
Последнее исправление: peregrine (всего исправлений: 1)
Ответ на: комментарий от den73

у меня vosk работает на древнем ведройд телефоне, который еще 10 лет назад просился в мусорку

комп слишком старый и новые линуксы

пеньтиум один что-ле?

anonymous
()
  • Markdown
Пустая строка (два раза Enter) начинает новый абзац. Знак '>' в начале абзаца выделяет абзац курсивом цитирования.
Внимание: прочитайте описание разметки Markdown.
Используйте Ctrl-Enter для размещения комментария