LINUX.ORG.RU
ФорумTalks

Самое точное техническое предсказание на LOR

 , ,


0

1

Наверное у jackill за фразу, сказанную в 2003-м году:

Имхо пока не начнется использование нейросетей переводчики так и не будут «чувствовать» контекст.

Здесь: Stylus for UNIX (комментарий)

В общем-то так оно и вышло. Хотя не совсем понимаю, что мешало ещё тогда и раньше прикрутить хотя бы байесовский классификатор для выбора нужного словаря из нескольких для конкретного параграфа. Но почему-то так или не делали или совсем не массово. Настройка на конкретную область существовала, но требовала повозиться с подгонкой и расстановкой приоритетов. Впрочем, и не сильно помогло бы.

★★★★★

Последнее исправление: anonymous_incognito (всего исправлений: 2)

Почему мне так интересно стало. Сейчас потихоньку ковыряю перевод с английского на русский разными LLM, ну и ищу всякое разное, в том числе на LOR и вот выпало. А ведь как бы считается, что в то время нейросети мало кому нужны были.

anonymous_incognito ★★★★★
() автор топика

А вы думали зачем все эти бесконечные раунды собеседований, тупые эйчарки, бесплатные тестовые задания, курсы изучения английского, мода на решение задачек на всяких литкодах и т.д.
Собирали материал чтобы нейронки тренить.

Bad_ptr ★★★★★
()

https://yandex.com/blog/yacompany-com/one-model-is-better-than-two-yu-yandex-translate-launches-a-hybrid-machine-translation-system

2017 год. А я подозревал, что у яндекса переводчик лучше не просто так. Он и сам языки подхватывал и переводил точнее много лет как.

С другой стороны гуглотранслейт перешел по слухам с 2016, но какого хрена у них до сих пор языки не распознаются и выдаетя мусор вместо перевода?

Ааа! Все, нашел. Гуглотранслейт сразу перешел на чистую нейросеть, а у яндекса гибридные походы. В любом случае, последние 16 лет яндекс лучше.

LightDiver ★★★★★
()
Последнее исправление: LightDiver (всего исправлений: 2)
Ответ на: комментарий от Bad_ptr

Ну, я как бы 16 лет сравниваю разныеы языки там и там. И гугл кроме английского везде несет чушь. Итальянский, испанскйи, португальский. Особено при переводе на русский и обратно. А вот яндекс еще 16 лет назад более менее нормально фразы формировал, когда я еще начинал изучать языки.

LightDiver ★★★★★
()

Это Google Translate не помогло, а даже в какой-то степени стало хуже. Как-то переводил на reddit тему в которой обсуждали Google Pixel. Там где в комментах название сокращали до 10 Pro, переводчик переводил как iPhone 10 Pro. Возможно Google для перевода использует очень облегченную модель, у которой либо очень маленький контекст, либо она быстро забывает что было ранее.

i7
()
Ответ на: комментарий от Bad_ptr

А вот латынь то я и не знаю, хотя понимаю все романские (почти). Так что не смогу оценить. Только очень косвенно. Примерно как русский 1000 лет назад.

LightDiver ★★★★★
()
Ответ на: комментарий от LightDiver

Я иногда использую для перевода страниц на сайтах локальную Gemma 4 или Qwen 3.5+ (навайбкодил расширение для хрома). По ощущениям Gemma часто переводит лучше чем Google Translate. GT очень часто спотыкается, когда намешан текст на разных языках.

i7
()
Ответ на: комментарий от i7

По ощущениям Gemma часто переводит лучше чем Google Translate.

По ощущениям гугл забил на переводчик еще до 2010 и развивают по остаточному принципу, как заброшенный проект. Они же даже интерфейс не дорабатывают.

LightDiver ★★★★★
()
Ответ на: комментарий от i7

Если руки дойдут напишу статью со сравнением. Но по моим ощущениям как бы не лучшая из доступных локально моделей - это несколько неожиданно, но Gigachat от Сбера. По крайней мере для англо-русского перевода художественной литературы. Насчёт технических текстов не уверен.

anonymous_incognito ★★★★★
() автор топика
Ответ на: комментарий от LightDiver

Они же даже интерфейс не дорабатывают.

А чего его там особо дорабатывать-то? Но переводчиком они ещё как занимаются. Даже архитектуру Transformer придумали в Google, причём первоначально как раз для целей перевода.

anonymous_incognito ★★★★★
() автор топика
Ответ на: комментарий от anonymous_incognito

Я как то пробовла воспользоваться гигачатом, так там можно было вставить текст размером в пару страница. Что то поменялось? Очень уж сложный у них доступ через спец браузер, лениво тестировать даже.

LightDiver ★★★★★
()
Ответ на: комментарий от LightDiver

Я локально запускал своей программой с разбитием на чанки.

anonymous_incognito ★★★★★
() автор топика

Что вышло-то? Ни google translate, ни deepl не понимают контекст все ещё. Более того, из-за языковых моделей у них при переводе могут происходить приступы шизы, например deepl мне иногда вставлял копирайт субтитров посреди перевода.

Gary ★★★★★
()

пока не начнется использование нейросетей переводчики так и не будут «чувствовать» контекст.

LLM не могут «чувствовать» контекст, например, эзопова языка, состоящего из аллюзий, антономасий, метафор, синекдох, … и прочих тропов.

прикрутить хотя бы байесовский классификатор для выбора нужного словаря из нескольких для конкретного параграфа.

Даже со словарями и классификаторами LLM порождают на Али чудовищные переводы конкретных описаний предлагаемых товаров.

quickquest ★★★★★
()
Последнее исправление: quickquest (всего исправлений: 1)
Ответ на: комментарий от Gary

Попробуй просто ChatGPT, Qwen, DeepSeek с промптом вроде «переведи на русский язык следующий текст» и далее текст для перевода. Можно даже текстовый файл, в том числе PDF, загрузить.

А вообще странно. Сейчас модели чувствуют контекст, хотя какие-то сложные аллюзии, тонкий юмор и тп. могут и не распознать. К тому же контекст может быть ограничен несколькими абзацами, особенно у специальных для перевода. У них, тем более у онлайн-сервисов, задача не просто перевести, но и сделать это достаточно быстро.

anonymous_incognito ★★★★★
() автор топика
Последнее исправление: anonymous_incognito (всего исправлений: 2)
Ответ на: комментарий от quickquest

LLM не могут «чувствовать» контекст, например, эзопова языка, состоящего из аллюзий, антономасий, метафор, синекдох, … и прочих тропов.

Слишком сложный могут и не «почувствовать», а могут и «почувствовать», если специально в промпте указать, что переводить надо, учитывая эзопов язык и аллюзии.

Даже со словарями и классификаторами LLM порождают на Али чудовищные переводы конкретных описаний предлагаемых товаров.

Ты сам переводил? Чем? Или продавцы где-то чем-то.

anonymous_incognito ★★★★★
() автор топика
Последнее исправление: anonymous_incognito (всего исправлений: 1)
Ответ на: комментарий от anonymous_incognito

В 2003ем как раз работал в проекте с реконструкцией 3д по фоткам как раз нейросеткой. Правда, наш проект свернули. Тогда ещё далеко не все понимали во что выльются нейросети. Но я тогда просто не верил, что появятся модели могущие говорить человеческим языком. Всякие Промпты и прочие электронные переводчики вызывали тогда то самое чувство, что сейчас испытывают орущие «нейрослоааап!!». Хотя, тогда гораздо больше поводов для этого было.

PcheloBiaka
()
Последнее исправление: PcheloBiaka (всего исправлений: 1)
Ответ на: комментарий от LightDiver

Был я на одном выступлении Яндекса, что-то там про Алису, КХ и прочее. Хорошо запомнил фразу: «Чтобы хорошо работать с русским языком, надо любить русский язык.»

bbc69
()
Ответ на: комментарий от bbc69

Хорошо запомнил фразу: «Чтобы хорошо работать с русским языком, надо любить русский язык.»

Хороший подход! В своё время когда я учил английский язык, у меня в голове крутилась фраза «Прежде чем учить второй язык, надо хорошо знать родной.»

VIT ★★★
()
Ответ на: комментарий от seiken

А ЛЛМ до сих пор в контекст не умеют.

Часто ими пользуетесь?

VIT ★★★
()
Ответ на: комментарий от quickquest

Я как-то в гугло неправильно вбил название песни Mack the Knife, написал «mock». И оно мне пояснило за смысл, выдумав его, как я понимаю, на ходу (что-то близкое к «игре с огнем»), а потом уже рассказало, что я ошибся и надо быть аккуратнее.

thesis ★★★★★
()
Ответ на: комментарий от jsoncpp

Чтобы понимать объяснение и аналогию неродного языка. Чтобы найти правильный образ. Чтобы владеть терминологией. Чтобы быть грамотным. Чтобы люди, мнение которых ты уважаешь, понимали тебя и не переспрашивали. Много причин.

VIT ★★★
()

Имхо пока не начнется использование нейросетей переводчики так и не будут «чувствовать» контекст.

Оно так и не научилось «чувствовать контекст», ибо даже кожаные переводчики не всегда его улавливают ввиду отсутствия компетенций в области обсуждаемого предмета. Короче, оно просто подбирает наиболее подходящее следующее слово исходя из предыдущих слов (там нет представления о предмете), там о контексте говорить буквально невозможно…

ЗЫ но, Да, сейчас автоматические переводчики справляются чуть лучше)))))

Sm0ke85
()
Ответ на: комментарий от Sm0ke85

Оно так и не научилось «чувствовать контекст»,

Похоже многие не понимают, что контекст оно таки научилось чувствовать, без него были бы анекдоты, а не переводы. Для примера не поленился сейчас поставить Promt XT 6.0 2002-го года. 2003-го не нашёл, но не думаю, чтобы велика разница была. По умолчанию с ним ставятся три словаря: общий, информатика и интернет.

Переводится предложение: «He got up and changed the computer boots, then changed his boots.»

Promt с общим словарём: «Он вставал и изменил{заменил} компьютерные ботинки, затем изменил{заменил} его ботинки.»

Promt со словарём Информатика: «Он вставал и изменил{заменил} компьютерные начальные загрузки, затем изменил{заменил} его начальные загрузки.»

Promt со словарём Интернет тоже самое выдал.

Попытки как-то комбинировать шаблоны и словари приводят к одному из двух вариантов.

Google Translate: «Он встал, сменил загрузку компьютера, а затем переобулся.»

Если заменить his на its то google translate снова понимает это как манипуляцию с загрузчиком: «Он встал и сменил загрузчик компьютера, затем снова сменил его загрузчик.»

Или вот ещё пример на контекст. I saw a huge crane near the river. The crane drank water.

Promt: «Я видел огромный подъемный кран около реки. Подъемный кран пил воду.»

Google: «Я увидел огромного журавля возле реки. Журавль пил воду.»

Если строят небоскрёб, а не пьют воду, то тут Stylus/Promt 2002-го года угадывает

«I saw a huge crane near the river. It was building a new skyscraper.»

Promt: «Я видел огромный подъемный кран около реки. Это строило новый небоскреб.»

Google: «Я увидел огромный кран возле реки. Он строил новый небоскреб.»

В данном случае в общем словаре Promt слово crane переводилось как кран (строительный), могло быть наоборот, тогда журавль строил бы новый небоскрёб :))

Нейросети могут учесть в контексте род (женский, мужской) человека и правильно перевести фразу с учётом рода.

«The doctor entered the room. She looked tired.»

google translate: «В комнату вошла врач. Она выглядела усталой.»

Разумеется, от Promt подобные нюансы бессмысленно требовать: «Доктор вступил в комнату{место}. Она выглядела утомленной.»

Ну и в целом, если дать на перевод научную статью, то более-менее хорошая LLM общего назначения её переведёт, причём с учётом тематики.

Короче, оно просто подбирает наиболее подходящее следующее слово исходя из предыдущих слов

Так ведь буквально оно и есть конктекст. Тем более, что в трансформерах там не совсем строго линейно всё подбирается.

anonymous_incognito ★★★★★
() автор топика
Последнее исправление: anonymous_incognito (всего исправлений: 3)
Ответ на: комментарий от anonymous_incognito

Переводится предложение: «He got up and changed the computer boots, then changed his boots.»

При этом данное предложение - не совсем стилистически корректное. В школе училки по этому поводу любили говорить «шёл дождь и рота красноармейцев». Интересно, а как вы переведёте это предложение, так сказать какой ваш идеальный вариант?

VIT ★★★
()
Последнее исправление: VIT (всего исправлений: 2)
Ответ на: комментарий от anonymous_incognito

Похоже многие не понимают, что контекст оно таки научилось чувствовать, без него были бы анекдоты, а не переводы.

Эти примеры не противоречат написанному мною. Но я говорил про случаи, когда существует, допустим, научная итальянская статья про «очередной синхрофазотрон». Итальянец в меру своих сил перевел на английский, а далее предлагается испытуемому перевести с английского на русский. Надо понимать, что в переводе «итал-англ» еще должны содержаться специфичные термины и слова с несколькими значениями (вроде ключ, ручка, мышь и т.п.) - это можно перевести близко к оригиналу (по замыслу) только реально понимая контекст (но правда остается еще шанс методом перебора всех наиболее вероятных возможных сочетаний слов что-то вменяемое получить, но это такое, как в анекдоте - 50/50…)

Sm0ke85
()
Ответ на: комментарий от Sm0ke85

Но я говорил про случаи, когда существует, допустим, научная итальянская статья про «очередной синхрофазотрон». Итальянец в меру своих сил перевел на английский, а далее предлагается испытуемому перевести с английского на русский.

По-моему тут и кожаный переводчик запросто может сплоховать, пытаясь понять в английском тексте, что имел ввиду итальянец. В узкотехнической области даже профессиональные переводчики, но не специалисты в переводимой области, запросто лажают. Отсюда ещё давно были все эти «надмозги». Если же итальянец корректно перевёл на английский, то сложность перевода такая же как просто с английского.

Но любопытно, если есть подобный пример, дать его поиграться, получится или нет вытянуть промптами про двойной перевод. Хотя я итальянского не знаю, так что и сам, скорее всего, могу не понять правильно.

anonymous_incognito ★★★★★
() автор топика
Последнее исправление: anonymous_incognito (всего исправлений: 1)
Ответ на: комментарий от VIT

При этом данное предложение - не совсем стилистически корректное.

Меня ещё давно восхищал перевод «Reboot the computer» как переботинок компьютер. Постарался такое двусмысленное выражение привести. Но вообще-то здесь не дождь и рота красноармейцев, просто последовательность действий человека. Он встал, сменил загрузчик компьютера, затем переобулся. Стилистически лучше было бы переобувание отдельным предложением записать.

anonymous_incognito ★★★★★
() автор топика
Ответ на: комментарий от anonymous_incognito

По-моему тут и кожаный переводчик запросто может сплоховать, пытаясь понять в английском тексте

Так и было))) Я когда таких статей на 300 000 знаков переводил, то преподаватель кивала и говорила: пусть будет так - тебе виднее, ибо тут очень кривой английский))))

Сейчас переводы конечно получше, но все равно мутновато может получаться, например тут смысл в общем понятен, но криво местами звучит (переводы совсем разные можно получать, с разными смыслами):

temporal interface

Sm0ke85
()
Ответ на: комментарий от anonymous_incognito

Я кстати уже забыл, кто и когда этот «переботинок» придумал и где он появился. Начало 90х, думаю год 1991…

«changed the computer boots» - вообще как-то не так звучит. Слова «got up» и «changed his boots» - это что-то из рыбалки, там, где ты спал, вдруг проснулся, а сапоги мокрые.

VIT ★★★
()
Ответ на: комментарий от i7

Проблема Google Translate в том, что он бесплатный и популярный. Это значит, что перевод оптимизирован для минимизации потребления ресурсов, а не для повышения качества.

Если хотите нормальный перевод - или покупайте подписку на специализированные сервисы. Или просто в любой хороший LLM загоняйте. Они переводят шикарно.

vbr ★★★★★
()
Ответ на: комментарий от anonymous_incognito

Меня ещё давно восхищал перевод «Reboot the computer» как переботинок компьютер.

С точки зрения лингвистики это типичная катахреза.

Стилистически лучше было бы переобувание отдельным предложением записать.

«Нинужна», есть «перезагрузка».

quickquest ★★★★★
()
Ответ на: комментарий от anonymous_incognito

...считается, что в то время нейросети мало кому нужны были.

Называлось оно по-другому, а так — интерес был. Просто произошло взрывное развитие средств ИТ.

sparkie ★★★★★
()
Ответ на: комментарий от VIT

Просто я их коллекционирую, в некотором роде.

sparkie ★★★★★
()

не совсем понимаю, что мешало ещё тогда и раньше прикрутить хотя бы байесовский классификатор для выбора нужного словаря из нескольких для конкретного параграфа

Впрочем, и не сильно помогло бы.

Именно так. Слишком трудоёмко. Слишком большие классификаторы нужны. Плюс, чтобы итоговый текст выглядел естественным, нужно сравнивать результат с образцами естественных текстов и подгонять под них.

В итоге получается, что программисты должны вручную или каким-то автоматизированным способом собрать нейросеть :) В идеале, если всё учесть, она получится компактнее и быстрее существующих. Но, имхо, дороже.

question4 ★★★★★
()
Ответ на: комментарий от quickquest

LLM не могут «чувствовать» контекст, например, эзопова языка, состоящего из аллюзий, антономасий, метафор, синекдох, … и прочих тропов.

Судя по «внутреннему монологу» Deepseek — вполне чувствуют и пользуются. Гугло-ИИ тоже понимает шутки и шутит.

Конечно, не всегда это работает, как надо.

question4 ★★★★★
()
Ответ на: комментарий от thesis

Mack the Knife, написал «mock».

«Насмехаться над ножом»? :)

question4 ★★★★★
()
Ответ на: комментарий от VIT

Слова «got up» и «changed his boots» - это что-то из рыбалки, там, где ты спал, вдруг проснулся, а сапоги мокрые.

Got up — необязательно проснулся. Можно и «встал со стула».

question4 ★★★★★
()
Ответ на: комментарий от vbr

Проблема Google Translate в том, что он бесплатный и популярный. Это значит, что перевод оптимизирован для минимизации потребления ресурсов, а не для повышения качества.

Он просто ограничивает объём. И он используется для сбора информации.

question4 ★★★★★
()
Ответ на: комментарий от sparkie

Чья фраза? Кто автор?

Когда я пытался подрабатывать переводчиком в середине 2000-х, в нескольких местах говорили, что берут только носителей языка НА который переводят.

question4 ★★★★★
()
Ответ на: комментарий от anonymous_incognito

Но переводчиком они ещё как занимаются. Даже архитектуру Transformer придумали в Google, причём первоначально как раз для целей перевода.

Гугл как обычно умудряется придумать сложные и полезные вещи и моментально обосраться при внедрении. Проблема с ui/ux у них как была, так и осталась, но они видимо считают что у них все идеально. у меня тут дико подгорало в очередной раз от автоперевода на ютубе, который с чего-то решил что мне нужен перевод на английский, и от карт, которые умудряются показывать в интерфейсе элементы относящиеся к 4(!) локалям/регионам. Впрочем наверно qa у них чисто на английском поэтому для них все ок.

Например перевод с тайского на английский у них как был ужасный, так и остался, толку от трансформеров? Гопатыч образца 2022 года и то намного лучше переводил, да и Яндекс кстати тоже.

user_undefined ★★
()
Вы не можете добавлять комментарии в эту тему: только для зарегистрированных, score>=50.