LINUX.ORG.RU

Какая это может быть кодировка?

 


0

1

Есть текстовые файлы, записанные в ~1988 году. (Если запостивший их соврал, то не позднее 1998.) Большая часть символов — 7-битный ASCII. Для некоторых знаков препинания (которые можно только угадывать из контекста) используется странная кодировка:
0x8a — многоточие или тире,
0x8b — короткое тире или дефис,
0x8c — открывающая кавычка, для которой 0xb9 — закрывающая,
0xad — может быть запятая (или одинарная нижняя кавычка), тире, двоеточие, многоточие,
0xb2 — закрывающая кавычка в паре с 0xb3,
0xb3 — открывающая кавычка в паре с 0xb2,
0xb9 — апостроф или одинарная верхняя кавычка.
Неясно, одинарные кавычки или двойные; ёлочки, лапки, или что-нибудь ещё; не перепутан ли порядок кавычек; как соотносятся длины тире.

Enca ничего подходящего не нашла. Перебор кодировок iconv дал ISO-IR-90 или ISO-IR-99 для 0xb9 как одинарной кавычки/апострофа и ничего подходящего для остальных. Возможно, эти файлы несколько раз перекодировали.

Как узнать, в какой кодировке были эти файлы? Просто интересно.

Если перебирать комбинации кодировок скриптом, как это лучше делать?

P.S. Текст на английском языке.

★★★★★

Последнее исправление: question4 (всего исправлений: 2)
Ответ на: комментарий от Beewek

Досовские редакторы символы CP866 портить бы не стали. На мой взгляд, это что-то, подготовленное к печати на принтере, у которого в старшей половине таблицы были типографские символы (а они у некоторых принтеров могли быть даже добавлены пользователем).

Ну, или, наугад — какой-нибудь ChiWriter. У него файлы как раз чистый ASCII с разметкой из стилей. Может, какая-то старая версия в служебных целях и символы > 128 использовала.

alegz ★★★★★
()
Ответ на: комментарий от Beewek

Возможно какие-то старые редакторы самовольничали.

Вероятно.

Лексикон или W&D (слово и дело).

Скорее, что-нибудь иностранное.

question4 ★★★★★
() автор топика
Ответ на: комментарий от Chord

MacCyrillic?

Не похоже.

Всё, что выводит iconv -l перепробовал, хотя мог что-то пропустить.

question4 ★★★★★
() автор топика
Ответ на: комментарий от futurama

Сам составь таблицу перекодировки.

Уже составил. Просто интересно, откуда она такая взялась.

question4 ★★★★★
() автор топика
Ответ на: комментарий от Beewek

нижняя половина кодовой таблицы нетронута, а всякие хитрые кавычки - в верхней половине.

Верно.

question4 ★★★★★
() автор топика

Думаю, это была ASCII-совместимая однобайтная кодировка, сделанная специально для конкретной программы-редактора, в котором был написан этот текст. Скорей всего все эти знаки отсутствуют в ASCII. И какого-то имени у этой кодировки нет, как и программ для её обработки.

Например я как-то работал с казахской кодировкой однобайтной. Там тоже никаких стандартов и прочего не было, люди просто придумали свою кодировку и реализовали её. Если тебя угораздит найти текст в этой кодировке, ты его ничем не декодируешь, только методами из пляшущих человечков. Но, что любопытно, в Windows они устанавливали специальную кодовую страницу, подменяли cp1251 и всё работало.

vbr ★★★★★
()
Последнее исправление: vbr (всего исправлений: 3)
Ответ на: комментарий от alegz

Ну, или, наугад — какой-нибудь ChiWriter. У него файлы как раз чистый ASCII с разметкой из стилей. Может, какая-то старая версия в служебных целях и символы > 128 использовала.

Знаю про самодельные шрифты, использовавшие 866-ю кодировку. Но исходный дистрибутив эти символы никак не интерпретирует.

question4 ★★★★★
() автор топика
Ответ на: комментарий от vbr

Думаю, это была ASCII-совместимая однобайтная кодировка, сделанная специально для конкретной программы-редактора

Возможно. И интересно, что это была за программа. Что-нибудь достаточно ходившее по BBS в конце 1980-х, чтобы обмениваться файлами в этом формате, но недостаточно распространённое, чтобы попасть в iconv.

question4 ★★★★★
() автор топика
Ответ на: комментарий от question4

Сначала нужно ответить на вопрос, кто и зачем стал бы использовать типографские символы в текстовом файле в 1988 году. Затем нужно принять во внимание язык, страну происхождения и жанр текста.

pasquale
()
Ответ на: комментарий от pasquale

Сначала нужно ответить на вопрос, кто и зачем стал бы использовать типографские символы в текстовом файле в 1988 году.

Выше правдоподобно предположили текстовый редактор уровня «Лексикона», W&D, ChiWriter. MS Word for DOS? WordPerfect? Их многочисленные забытые конкуренты?

Затем нужно принять во внимание язык, страну происхождения и жанр текста.

Английский, США (вероятно), черновики фантастического романа, который якобы рассматривали в издательстве, когда автор предположительно погиб в ДТП.

Альтернативная версия: 1998 год, английский, США, черновики фантастического романа, который в свободное время писал и бросил сотрудник «Боинга», который позже умер от ХОБЛ (курил много).

Роман в жанре боди-хорор и наружает законы РФ, поэтому ссылок не будет.

question4 ★★★★★
() автор топика
Ответ на: комментарий от question4

текстовый редактор уровня «Лексикона»

А ещё, если 1988, то тогда был актуален Wang typewriter (не редактор). Правда, под WISCII символы из стартового поста не подходят, но, может у Wang были неизвестные конкуренты...

mky ★★★★★
()
Ответ на: комментарий от anonymous

чатгпт

Он меня, фактически, забанил. Я так часто говорил ему «неправильно, переделывай», что он стал отвечать в 1 строку.

question4 ★★★★★
() автор топика
Ответ на: комментарий от mky

Вот да, какой-нибудь «текстовый процессор», как это тогда называлось. Судя по вики, тогда в старшую половину ASCII пихали что попало все, кому не лень.

anonymous
()
Ответ на: комментарий от anonymous

причём я имею в виду именно железный «процессор» - пишущая машинка с экраном. Wang как раз такие делал.

anonymous
()
Ответ на: комментарий от question4

Так есть же не только чатгпт. Дипсик хотя бы. Мне интересно, решат ли они твою задачу, раз файлы ты не показываешь.

anonymous
()

Возможно, эти файлы несколько раз перекодировали.

вот этот пункт сводит смысл всех гаданий на нет. в особенности, если реально исходник был от какого-то текст-процессора. гораздо проще вывести значение символов из контекста, с учётом типографской традиции (предполагаемой) страны происхождения файлов.

anonymous
()

Покажи уже любой файл, или настолько секретно? Что там такого было в 88 году то.

anonymous
()
  • Markdown
Пустая строка (два раза Enter) начинает новый абзац. Знак '>' в начале абзаца выделяет абзац курсивом цитирования.
Внимание: прочитайте описание разметки Markdown.
Используйте Ctrl-Enter для размещения комментария