LINUX.ORG.RU

Кто как вводит иероглифы?

 , , , ,


0

2

Кто пользуется китайским или японским языком, как вы вводите иероглифы, произношения которых не знаете? Перепробовал много чего, но всё в итоге требует произношения. Кроме Kanjipad, но он мой почерк вообще не понимает.

P.S. Совсем забыл: есть поиск по радикалам в Kiten. Но там странно выглядят сокращённые варианты ключей (например, для 水 汁 вместо 氵, 水 вместо 氺), и редкие иероглифы могут отсутствовать (из ~20 иероглифов с 氺 есть всего 2). И рисовать было бы быстрее.

Какие приложения в современном десктопном Линуксе позволяют опознать нарисованный иероглиф или найти его по ключам? Без подключения к интернету.

UPD2: Вот тут хорошо распознаёт: https://kanji.sljfaq.org/draw.html, есть куча наворотов: Undo, опциональный учёт порядка и направления черт, несколько удобных реализаций поиска по радикалам (включая с учётом положения). Ищу оффлайн-версию. — Всё закрыто, оффлайн-версия недоступна.

★★★★★

Последнее исправление: question4 (всего исправлений: 6)
Ответ на: комментарий от Sylvia

translate.(google||yandex).com

А не доступен ли рисовательно-распознавательный компонент отдельно? Я нашёл только гугловский mozc, но распознавание туда не входит.

question4 ★★★★★
() автор топика

Кроме Kanjipad, но он мой почерк вообще не понимает.

Вроде бы с иероглифами считается очень важным, как их рисовать, а не только как в итоге выглядит, то есть конкретная палка должна быть например сверху вниз, и если снизу вверх нарисуешь, будет неправильно, или не в том порядке — типа сперва горизонтальную палку, а потом вертикальную, или наоборот, и не перепутай. В итоге выглядеть может считай одинаково, но одно «правильно», другое «неправильно». Почти уверен, что проблема в этом — надо научиться «правильно» рисовать иероглифы (в смысле в правильном именно порядке и направлении), и тогда начнёт понимать.

CrX ★★★★★
()
Ответ на: комментарий от CrX

Вроде бы с иероглифами считается очень важным, как их рисовать, … конкретная палка должна быть например сверху вниз …

Так и делаю (ориентируюсь на Wiktionary). Но даже простейшие вещи вроде 人 Kanjipad не опознаёт.

А вот Google Translate и даже EDict под PalmOS, на порядок и направление черт внимания не обращают.

question4 ★★★★★
() автор топика

Арчвики говорит, что есть схемы для rime для ввода именно по графике, rime-wubi и rime-stroke. Сам, впрочем, не пробовал, мне хватает rime-luna-pinyin. А если не хватает, накорябаю пальцем в телефоне (Pleco) и введу таки фонетически.

JaneDoe
()
Ответ на: комментарий от question4

EDict под PalmOS

Погуглил. Похоже, EDict под PalmOS и Kanjipad используют одни и те же «Todd David Rudicks’s algorithms from JavaDict», и на 160x160 пикселах это работало гораздо лучше, чем на 360х360.

question4 ★★★★★
() автор топика

Раньше когда-то настраивал нативный ввод с клавиатуры, вроде через ibus это было, но это не точно.

Сейчас если сильно приспичит, иду в гугл транслейт, там если выбрать, условно, японский, то можно зная чтение можно ввести английским, и потом классически жмакнуть пробел, и вуаля, выбирай возможные варианты какие иероглифы подходят под напечатанное. (Условно пишем nihonngo, жмак, получаем 日本語). Но это надо знать чтение искомого текста, да.

С вводом при помощи рисования никогда не сталкивался, так что хз как там обстоят дела.

nrader
()
Последнее исправление: nrader (всего исправлений: 2)
Ответ на: комментарий от nrader

Раньше когда-то настраивал нативный ввод с клавиатуры, вроде через ibus это было, но это не точно.

Это я уже настроил. Но подавляющее большинство методов ввода через ibus, scim и fcitx требуют знать произношение, и именно в этом проблема. Туда можно прикрутить рисование, но готового в основном дереве Portage, похоже, нет. Поэтому и спрашиваю.

С вводом при помощи рисования никогда не сталкивался, так что хз как там обстоят дела.

В начале 2000-х была программа на Java, которую всюду портировали. Но похоже, алгоритм плохо работает с тонкими линиями при высоком разрешении. Вот рабочая веб-версия: https://kanji.sljfaq.org/draw.html, но мне хотелось бы оффлайн.

question4 ★★★★★
() автор топика
Ответ на: комментарий от JaneDoe

есть схемы для rime для ввода именно по графике, rime-wubi и rime-stroke.

Для этого надо возиться с оверлеями Дженту. Поэтому и спрашиваю, кто имеет опыт, на что стоит тратить усилия.

Если не ошибаюсь, wubi — это сборка иероглифов из ключей на специальной китайской клавиатуре (наборы наклеек от ~80р. на Озоне и Алиэкспрессе). Считается более быстрым методом, чем по произношению (кана и пиньинь). А stroke может быть как раз рисованием.

question4 ★★★★★
() автор топика

если реально не знаю произношения, пользуюсь поиском по радикалам jisho.org. рисование там есть тоже.

anonymous
()
Ответ на: комментарий от anonymous

пользуюсь поиском по радикалам jisho.org

А у него оффлайн-версия есть?

P.S. Попробовал. По радикалам ищет нормально. Но мои попытки изобразить 人 он распознал не лучше, чем Kanjipad.

question4 ★★★★★
() автор топика
Последнее исправление: question4 (всего исправлений: 2)

Беглый гугель вывел на https://github.com/dariyooo/DaKanji

Попробовал несколько иероглифов, вроде офлайн, вроде работает. Не знаю, что за проблема с 人, у меня распознался。 Ну, если не совсем как / \ рисовать. Я правда в ваш японский не умею, рисовал по-китайски.

JaneDoe
()

Пользуюсь ibus. Там есть выпадающий список с выбором нужного иероглифа по корню или сердцу иероглифа. Надо знать, как пишется иероглиф, чтобы выбрать соответствующий. Но это нормально. Если кто-то не знает нужный язык, то ему и не нужно писать на нём.

Clockwork ★★★★★
()
Ответ на: комментарий от Clockwork

Пользуюсь ibus.

ibus — основа. Я спрашиваю про конкретную программу для ввода иероглифов, которая взаимодействует с ibus. Какой дистрибутив и DE?

И почему-то всюду советуют отказываться от ibus, как от устаревшего. Не поддерживается Wayland-ом?

по корню или сердцу

Чему?

Надо знать, как пишется иероглиф,

Знать транскрипцию или что? Пиньинь? Ромадзи? Хирагану? Уби-цзысин? Чжуинь?

Если кто-то не знает нужный язык, то ему и не нужно писать на нём.

Может ещё и изучать иностранные языки запретишь?

question4 ★★★★★
() автор топика
Последнее исправление: question4 (всего исправлений: 1)
Ответ на: комментарий от question4

ibus — основа. Я спрашиваю про конкретную программу для ввода иероглифов, которая взаимодействует с ibus.

ibus — это фреймворк для ввода, а сами методы ввода подключаются как отдельные движки. У меня установлен сам фреймворк ibus и движок ibus-anthy.

pkg info | grep  ibus
ibus-1.5.33_2                  Intelligent Input Bus for Unix-like systems
ja-ibus-anthy-1.5.17_2         Anthy engine for IBus

Какой дистрибутив и DE?

Я использую на FreeBSD с Awesome WM. Но вот в Ubuntu и производных (GNOME, KDE, XFCE) ibus обычно предустановлен, и движки можно поставить через пакетный менеджер.

Не поддерживается Wayland-ом?

Не знаю. У меня X.

Чему?

Это то, что обычно называют ключом (радикалом). Радикал — это базовый элемент, из которого строится кандзи. Простыми словами это как «корень слова»: он несёт основное значение.

Знать транскрипцию или что?

Я пишу текст любой азбукой, будь то катакана или хирагана. Мне важно лишь знать как оно пишется и читается азбукой. Когда я дописал нужное слово, я нажал пробел и мне автоматически заменяет это слово на иероглиф. Если этот иероглиф не подходит, то я еще раз нажимаю пробел и открывается список с всевозможными вариантами, которые подходят под это слово. Можно оставить слово азбукой или выбрать другой иероглиф.

Может ещё и изучать иностранные языки запретишь?

Я ничего не запрещаю. Если человек совсем не владеет языком, то ему просто нечего на нём писать. Но как только он начинает изучать — пусть даже с азов — у него уже появляется материал для практики, и тогда письмо становится осмысленным.
Бессмысленно, конечно, можно просто выводить иероглифы и красоваться перед одноклассниками, но пользы от этого никакой не будет. Это похоже на то, как если бы кто‑то переписывал красивые формулы из математики, не понимая их смысла: выглядит эффектно, но знаний не прибавляется.

Clockwork ★★★★★
()
Ответ на: комментарий от Clockwork

Я ничего не запрещаю. Если человек совсем не владеет языком, то ему просто нечего на нём писать. Но как только он начинает изучать — пусть даже с азов — у него уже появляется материал для практики, и тогда письмо становится осмысленным.

А если человек изучает язык, но какой-то иероглиф увидел впервые и хочет узнать, как он читается и/или что значит? По-моему, вполне себе нормальная задача.

CrX ★★★★★
()
Ответ на: комментарий от CrX

А если человек изучает язык, но какой-то иероглиф увидел впервые и хочет узнать, как он читается и/или что значит?

Если человек увидел иероглиф на сабже, то он не будет его писать, ему нужно обратное решение: из кандзи получить значение/перевод (фактически из рисунка) и для этого есть уже другие инструменты, совсем не те, о которых я говорил. Наверняка для линукс есть рукописная клавиатура, которая позволяет нарисовать иероглиф мышкой/стилусом.

Мне не доводилось решать такую задачу. Только пользовался аналогичными решениями для андроида, которых полно.

Clockwork ★★★★★
()
Ответ на: комментарий от Clockwork

Если человек увидел иероглиф на сабже, то он не будет его писать, ему нужно обратное решение: из кандзи получить значение/перевод (фактически из рисунка)

Как это не будет? Именно чтобы получить значение/перевод, ему нужно каким-то образом «показать» этот иероглиф компьютеру. Да, есть вариант с камерой телефона, например. Но это не всегда удобно или даже вообще возможно.

Наверняка для линукс есть рукописная клавиатура, которая позволяет нарисовать иероглиф мышкой/стилусом.

Так а тред о чём? ТС именно что-то вот такое и ищет!

CrX ★★★★★
()
Последнее исправление: CrX (всего исправлений: 2)
Ответ на: комментарий от Clockwork

ja-ibus-anthy

Спасибо, я пробовал fcitx-anthy, но нашёл только ввод ромадзи и каны. Как называется ввод ключей/радикалов в русской локализации?

Бессмысленно … выводить иероглифы

Как ещё искать в электронном словаре иероглиф из бумажного текста? Веб-камеры нет, MTP на телефоне дико тормозит.

question4 ★★★★★
() автор топика
Ответ на: комментарий от question4

Если тебе нужен именно поиск кандзи по радикалам или рисование, то это реализуется не в IME, а в отдельных словарных программах или онлайн‑сервисах:

  • Kiten (KDE) — поиск по радикалам.

  • Gjiten (GNOME) — аналогично.

  • Онлайн‑словари вроде Jisho.org позволяют искать кандзи по ключам или рисовать их мышью/стилусом.

anonymous
()
Ответ на: комментарий от question4

А не доступен ли рисовательно-распознавательный компонент отдельно? Я нашёл только гугловский mozc, но распознавание туда не входит.

он то доступен, но рисовать тоже нужно соблюдая порядок черт что запомнить сложнее чем пининь

cylon17
()
Ответ на: комментарий от anonymous

поиск кандзи по радикалам или рисование, то это реализуется не в IME,

Я спрашиваю про программы, которые могут интегрироваться в IME.

Онлайн‑словари

Каким местом ты прочитал «Без подключения к интернету»? :)

Jisho.org

Не лучше Kanjipad. Как я понял, первоисточник один.

question4 ★★★★★
() автор топика
Ответ на: комментарий от cylon17

А не доступен ли рисовательно-распознавательный компонент отдельно?

он то доступен,

Как им воспользоваться?

но рисовать тоже нужно соблюдая порядок черт что запомнить сложнее чем пининь

В веб-интерфейсе google.translate номера черт не проставляются, и то, что я рисую, распознаётся.

question4 ★★★★★
() автор топика

В moz есть рукописный ввод, сейчас не работает у меня, использую яркси на телефоне.

anonymous
()
Ответ на: комментарий от One

google.com/ai

Предлагает ставить несуществующие пакеты с несуществующими USE флагами.

question4 ★★★★★
() автор топика
Ответ на: комментарий от question4

Какой эмулятор Андроида проще поставить?

хз вариантов особо то и нет. Genymotion Desktop ну или от android studio

cylon17
()
Ответ на: комментарий от question4

еще вариант, конечно это не клавиатура и не ввод, взять qwen2.5vl:3b в ollama или любую другую мультимодальную модель и разпознавать картинки нейронкой рисуй их как хочешь.

тоже офлайн но не быстро все от мощности твоего компа и кртинки рисовать сохранять вставлять много телодвижений.

cylon17
()
Последнее исправление: cylon17 (всего исправлений: 1)

Какие приложения в современном десктопном Линуксе позволяют опознать нарисованный иероглиф или найти его по ключам? Без подключения к интернету.

Если для десктопа и совсем без интернета, то вот несколько вариантов.

  • какая-нибудь локально запускаемая нейросеть с опцией распознавания текста (кстати, есть специальные нейронки, предназначенные именно для распознавания, например). Неплохо с этим справляются (по моему опыту) qwen и gemma, но искать надо именно те модели, которые умеют в обработку изображений (к ним надо ещё mmproj-файл докачивать).
  • прога NormCap. Выделил текст - она сразу его в фоне распознала и поместила в буфер распознанный текст. Правда, работает глючно и непредсказуемо.
  • проги-распознавалки типа ocrfeeder, но они тоже предсказуемостью не блещут.
  • если работаешь с большими отсканированными текстами (манга и т.п.) - присмотрись к программе mokuro.
  • в теории можно воспользоваться бумажным словарём (или найти такой словарь в pdf). Там кандзи отсортированы по ключам. Видишь 泳 (например) - ключ 氵, значит, надо в словаре открыть раздел с этим ключом и в нём уже искать.
Mapper720
()
Последнее исправление: Mapper720 (всего исправлений: 3)

Вот небольшая прога, появившаяся после 5-10 минут общения с chatgpt. https://transfiles.ru/9fd78

Запускаешь в папке локальный сервер и получаешь простенький конструктор «выбери радикалы и узри список кандзи, в которых эти радикалы присутствуют».

Mapper720
()
Ответ на: комментарий от Mapper720

Вот небольшая прога, появившаяся после 5-10 минут общения с chatgpt. https://transfiles.ru/9fd78

Спасибо, посмотрел. Использует данные от XJDIC и WWWJDIC. Как и EDict ~2000 года. Как и упомянутый в стартовом посте Kiten.

Покрутил немного. Пожалуй, я несправедливо ругал Kiten — там нет 氵 потому, что там 汁.

mokuro

Спасибо. PyTorch и Claude… И без поддержки китайского.

можно воспользоваться бумажным словарём … Там кандзи отсортированы по ключам.

Опыт есть. В первый раз 1 страницу ёнкомы переводил несколько часов :) Также есть GoldenDict со словарём KangXi Radical Index. Вопрос задал в поисках чего-нибудь существенно более удобного и быстрого.

question4 ★★★★★
() автор топика
Ответ на: комментарий от question4

Использует данные от XJDIC и WWWJDIC. Как и EDict ~2000 года

Мне думается, чуть более чем все словари используют плюс-минус одни и те же базы данных.

Пожалуй, я несправедливо ругал Kiten — там нет 氵 потому, что там 汁

Меня, кстати, отсутствие 氵 тоже удивило. Я-то первым делом попытался 泳 найти))

PyTorch и Claude

Claude?

Вопрос задал в поисках чего-нибудь существенно более удобного и быстрого

Например? Если не знаешь чтений, то варианта ровно три: либо распознавание текста, либо поиск по радикалам, либо рукописный ввод (но даже если отыщется такая прога, делать это мышкой – удовольствие крайне сомнительное).

Mapper720
()
Ответ на: комментарий от Mapper720

все словари используют плюс-минус одни и те же базы данных.

Например, в Wiktionary списки ключей более длинные, чем в этом kanjidic.

Например?

История успеха настройки wubi.

Готовый пакет, где есть вызов по горячей клавише окна поиска по радикалам, не требующего мыши.

Вызов из контекстного меню десктопной версии рисовалки с kanji.sljfaq.org или от Google Translate.

question4 ★★★★★
() автор топика
Ответ на: комментарий от anonymous

https://github.com/taku910/zinnia https://tegaki.github.io/

Спасибо, примерно это у меня стоит с самого начала. app-i18n/ibus-handwrite по зависимостям тянет app-i18n/zinnia, но app-i18n/zinnia вытянул модель app-i18n/zinnia-tomoe. Думаю, если поставить app-i18n/tegaki-zinnia-japanese, можно будет подключить модель tegaki.

Вопрос в другом: как включить этот модуль в настройках методов ввода? У меня это список из ~800 пунктов, криво переведённых на русский, но с поиском на английском. Ни «zinnia», ни «зинниа», ни «зинния», ни «рукопис», ни «handwriting» там нет.

question4 ★★★★★
() автор топика
Ответ на: комментарий от anonymous

@nrader, @Clockwork и все остальные, кто пользуется ibus: как положено задавать его использование в X Window и KDE?

Я вставил QT_IM_MODULE=ibus в начало .xinitrc:

#!/bin/sh
export QT_IM_MODULE=ibus
exec dbus-launch --exit-with-session startplasma-x11

В результате все программы, запускаемые вручную, нормально работают с ibus, но запускаемые при старте иксов (оставшиеся с прошлого раза) эту переменную не видят. В чём проблема?

question4 ★★★★★
() автор топика

Я не пользуюсь иероглифами, но можно посмотреть на KChartSelect. Там вроде бы есть. Работает оффлайн, но нужно найти и поставить подходящий шрифт. У себя сейчас глянул, есть куча всякого, в том числе очень экзотического, но из-за того, что у меня нет подходящего шрифта, конкретно из иероглифов отображается процентов десять - остальное квадратиками.

shell-script ★★★★★
()
Ответ на: комментарий от shell-script

Я не пользуюсь иероглифами, но можно посмотреть на KChartSelect.

Нужно ОЧЕНЬ хорошо знать иероглифы, чтобы найти в KCharSelect нужный. Или каждый раз просматривать ~40 тысяч символов в поисках нужного. Даже если они там отсортированы по корням (не уверен), не всегда можно угадать корень, по которому сортировали. В Kiten, по крайней мере, можно ввести любые из корней (кроме входящих в более сложные), и найдёт.

question4 ★★★★★
() автор топика

Любой термин это тоже своего рода «иероглиф». Китайцы решили эту проблему на все 100%.

anonymous
()
Ответ на: комментарий от question4

Когда ты используешь dbus-launch --exit-with-session startplasma-x11, Plasma сама восстанавливает предыдущую сессию (программы, которые были открыты в прошлый раз). Эти процессы стартуют не из .xinitrc, а из механизма автозапуска Plasma, и поэтому они не видят переменные окружения.

У меня в .xinitrc следующее:

# ibus:
export XIM=ibus
export GTK_IM_MODULE=ibus
export QT_IM_MODULE=ibus
export XMODIFIERS=@im=ibus
export XIM_PROGRAM="ibus-daemon"
export XIM_ARGS="--daemonize --xim"
ibus-daemon --daemonize --xim

Я не использую KDE, но теоретически это поможет. Разумеется если ibus-daemon стартует до Plasma и переменные окружения экспортируются до вызова exec dbus-launch ....

Clockwork ★★★★★
()
Ответ на: комментарий от Clockwork

Когда ты используешь dbus-launch –exit-with-session startplasma-x11, Plasma сама восстанавливает предыдущую сессию (программы, которые были открыты в прошлый раз). Эти процессы стартуют не из .xinitrc, а из механизма автозапуска Plasma, и поэтому они не видят переменные окружения.

Спасибо. Похоже, в этом было дело.

question4 ★★★★★
() автор топика
  • Markdown
Пустая строка (два раза Enter) начинает новый абзац. Знак '>' в начале абзаца выделяет абзац курсивом цитирования.
Внимание: прочитайте описание разметки Markdown.
Используйте Ctrl-Enter для размещения комментария