Товарищи, Вы чего? Седьмой акробат имеет русский OCR (надо доп плагины ставить), да и полвина софта для для работы с djvu тоже поддерживает. Только конечно все требует серийников или работает ОЧЕНЬ медленно.
Седьмой акробат (не реадер!) поддерживает русский OCR, т.е. когда Вы открываете какой-нибудь текст у Вас есть возможность выполнить для него OCR. По-моему нужно ставить доп. плагин. Для винды у меня сие есть. Для линукса версией пока не озаботился.
Теперь на счет djvu. Ситуация аналогичная. Есть например, кажется, Editor --- только для поверхностного редактирования. Более мощный софт это... БЛИН ДИСК СПЕРЛИ!!! 8Гб софта для DjVu. Ну что за люди! Короче был у меня один пакетный преобразователь файлов в этот формат он тоже мог еще и OCR проводить. Разумеется требовал лицензии. Говорят есть и бесплатная версия, т.к. вначале djvu было в основном некоммерческим.
огромный список программ есть на http://www.djvu-soft.narod.ru/ когда-то у меня была копия этого сайта. В основном пользовался Document Express Enterprise with DjVu v5.1 build 946 (with Asian OCR), правда под винду.
Если найдешь там что-то с открытым кодом и OCR кинь ссылку, интересно.
А где Вы в kpdf OCR нашли? В седьмом акробате в явном виде есть утилита позволяющая провести "OCR" распознование текста. "OCR" сказано в явном виде. В kpdf я этого не нашел.
Выделить Вы сможете только тот текст который записан как текст в
pdf-файле. OCR обрабатывает картинку. Гм, чтобы было понятнее приведу примерный план действий.
1) Сканируете страницу из книги, получаете jpg-файл.
2) Сохраняете его как pdf.
Итог: у вас есть pdf-файл в котором содержится только картинка в формате jpg. Выделить текст в ней Вы не сумеете, т.к. его там просто нет!
3) Теперь открываете его седьмым акробатом, у него есть где-то в меню
возможность применить OCR к файлу.
Итог: у Вас есть файл, в котором есть картинка + некоторый текст,
который получен OCR. Текст находится в "невидимом" слое. Т.е. при
просмотре Вы по-прежнему видите картинку, но теперь можете выделять
текст. Более подробно см. по ссылке, которую я указал ранее.
т.е. это как? По страницам видно, что он и сканированные! Вообще, взял бы сам kpdf и проверил. А то говорим непонятно о чём. (у меня сейчас нет возможности проверить)
Я еще раз повторяю, что OCR не означает ТОЛЬКО текст. Технология OCR позволяет совмещать текст распознанный и отсканированный, т.к. при распознавании неизбежны ошибки. Вы видите одновременно и ОТСКАНИРОВАННЫЙ текст (картинка, полосы, буквы...) и РАСПОЗНАННЫЙ текст (то, что Вы выделяете).
По-моему ничего нет. FineReader толи был толи есть толи планируется под
linux, но там были каки-то странные заморочки. Толи только сервер. толи что-то ещё.
Но с Вашими талантами, глядишь скоро и поавится:-D