LINUX.ORG.RU

Проект rars подготовил свободную реализацию RAR с поддержкой создания архивов

 , , , ,


1

3

https://www.opennet.ru/opennews/art.shtml?num=65765:

Представлен проект rars, развивающий свободную реализацию инструментария для формата RAR, написанную на языке Rust и поддерживающую не только распаковку, но и создание RAR-архивов. Инструментарий поддерживает как ранние форматы RAR 1.3/1.4 с сигнатурой RE~^, так и последнюю версию RAR 7. Доступны такие расширенные операции, как разбиение на тома, защита паролем, шифрование заголовков, прикрепление комментариев, RARVM-фильтры, индексы для быстрого открытия и механизмы восстановления повреждённых данных. Код распространяется под лицензиями MIT и Apache-2.0. На базе библиотеки PyO3 подготовлены обвязки для языка Python, которые реализуют API в стиле rarfile для просмотра, тестирования и извлечения архивов, а также API в стиле RarBuilder для создания или перепаковки архивов.

Особенность проекта в том, что он реализует работу с форматом RAR без использования кода утилиты unrar, распространяемой под несвободной лицензией, которая запрещает использовать код unrar для воссоздания алгоритма сжатия RAR или разработки RAR-совместимого архиватора. Из-за данного ограничения большинство свободных архиваторов ограничивались лишь функциями распаковки RAR-файлов, а для создания RAR-архивов приходилось использовать проприетарный инструментарий от RARLAB.

Отдельно создан репозиторий rar-research в котором опубликованы спецификации для форматов RAR 1.3/1.4, RAR 1.5-4.x и RAR 5.0/7.0, а также заметки по используемым алгоритмам, фильтрам, методам проверки и восстановления целостности, шифрованию, разбиению на тома и механизмам защиты. Так как на момент создания проекта rars официальной полноценной спецификации не существовало, документация была воссоздана по коду распаковщиков, старым реализациям, тестовым архивам и анализу бинарных версий RAR для DOS и Windows.

Реализация была создана с использованием AI-инструментов OpenAI Codex 5.5 и Claude Opus 4.7 в свободное от работы время примерно за пять недель. На первом этапе модели применялись для систематизации информации о формате и восполнения пробелов в описании, после чего по восстановленной спецификации был сгенерирован код на языке Rust. Для уточнения спецификации и оттачивания реализации использовалась проверка работы на реальных архивах и сравнение с эталонными реализациями.

Отмечается, что AI-инструменты хорошо справились с переносом формального описания в код и с рутинной реализацией большого объёма функциональности, но не смогли обеспечить архитектурный контроль. Без жёсткого надзора AI-модели были склонны обходить тесты, усложнять код и пропускать очевидные проблемы, влияющие на удобство работы. По оценке автора, в проекте такого масштаба тесты, документация и комментарии стали не только инструментами проверки, но и способом направлять генерацию кода в нужное русло.

Форсировать разработку удалось после появления в OpenAI Codex режима /goal, позволяющего AI-агенту длительное время работать над одной задачей, сжимая контекст и продолжая выполнение после его переполнения. В таком режиме Codex несколько раз работал больше чем 6 часов и один раз около 16 часов, реализуя значительную часть оставшейся функциональности, такой как восстановление данных, шифрование и многотомные архивы. С учётом значительной субсидии на токены было потрачено 40 фунтов стерлингов.

По уровню сжатия rars в среднем на 5-10% отстаёт от WinRAR. По скорости сжатия и распаковки rars существенно медленнее WinRAR из-за отсутствия полноценных оптимизаций. При этом в проекте уже имеется режим --features fast, применяющий оптимизации на основе SIMD-инструкций для ускорения сжатия и распаковки, но завязанный на экспериментальный API std::simd, доступных только в тестовых сборках инструментария Rust. Также реализован режим --features parallel, использующий библиотеку Rayon для распараллеливания сжатия отдельных файлов.


Евгений Рошал, создатель RAR, прокомментировал использование обратного инжиниринга старых бинарных файлов RAR при разработке rars, что запрещено лицензионным соглашением. По словам Евгения, он пока не определился, что с этим делать и намерен дождаться мнения компании win.rar GmbH.

★★★★★

Последнее исправление: dataman (всего исправлений: 1)
Ответ на: комментарий от peregrine

Вообще с бекапами беда если честно. Корпоративные решения внутри однородной среды как-то работают, … И именно по этой причине всякие облака расцвели

Вообще не по этой причине облака появились. Про расцвет можно спорить.

Есть мнение, что облака появились как предпосылка для накопления данных. Без этого накопления не появились бы эти самые большие языковые модели. Их банально на чём то надо учить, а учить модель на случайном агенте в интернете дорого и долго.

VIT ★★★
()
Ответ на: комментарий от VIT

Как учили их на краулерах, так и учат. Точно также поисковики работают, только ИИ-шные краулеры ещё и на robots.txt болт класть могут. А облака возникли т.к. удобных средств передачи файлов нет. Через мыло и размер ограничен и неудобно. Мессенджеры - помойка, а торренты не безопасно (секьюрных торрентов для передачи файлов так никто и не сделал, чтоб ни подсмотреть нельзя было совсем левым челикам, ни поднасрать раздав вирусню, там даже с хешами долго проблемы были, слабые они).

peregrine ★★★★★
()
Последнее исправление: peregrine (всего исправлений: 2)
Ответ на: комментарий от peregrine

А фоточки где брать? А манеру общения? А Facebook сидит на своих данных в носу ковыряет? А Microsoft свой CoPilot от нечего делать внедряет? Про Apple и Google не знает только ленивый.

Со своимим агентами вы обучаться будете до второго пришествия.

VIT ★★★
()
Ответ на: комментарий от VIT

А фоточки где брать?

Всё там же, всё там же. Краулеру никто не мешает браузером прикидываться. Или хеадлесс хромоножкой по страницам ходить, когда бьютифулсупа мало. Фейсбук свои данные сам вытащит, они у него на его сервере лежат, ему не трудно. В принципе реддит так и стянули, там потом владельцы вроде как возмущались на гугл за это. Краулер не надо недооценивать. Поисковые краулеры вполне себе весь инет просканировали и не раз.

peregrine ★★★★★
()
Последнее исправление: peregrine (всего исправлений: 2)
Ответ на: комментарий от VIT

Я так понимаю новое течение, где один политик якобы укусил другого политика, особенно та часть, которая была намеренно скормлена ИИ, прошла мимо вас, @peregrine.

VIT ★★★
()
Ответ на: комментарий от VIT

Политики никак не влияют на технические решения (единственное что они могут инет в отдельно взятой стране выключить). А вот боты стали ходить по сайтам как не в себя с ростом и развитием ИИ. Или думаешь что ЛОР не парсится гуглом и на нём потом gemini не учат? Учат и ещё как. Я тебе больше скажу - флибусту скачивают с торрента и на ней тоже учат, только не афишируют. Тоже самое касается либгена. Потому сейчас в РФ стараются легализовать обучение моделек яндекса и сбера на контенте под авторскими правами.

peregrine ★★★★★
()
Последнее исправление: peregrine (всего исправлений: 5)
Ответ на: комментарий от peregrine

Я не отрицаю того факта, что если у тебя нет прикормленной базы данных пользователей, то нужно что-то делать. Я оспариваю тезис «Вообще с бекапами беда если честно. Корпоративные решения внутри однородной среды как-то работают, … И именно по этой причине всякие облака расцвели».

Облака появились намеренно, и не как средство бекапа, как об этом с самого начала заявила Apple. Впрочем, даже она понимала всю глупость этого тезиса для пользователей, поэтому продвигала свой iCloud как средство синхронизации между своими устройствами, а не бекап (её пользователи слов то таких не знают). И говорилось там всегда про фоточки и чатики, а не бизнес файлы и документы.

VIT ★★★
()
Ответ на: комментарий от peregrine

дык у меня тоже данные синхронятся между линухой, виндой и андроидом. косяки опредленные конечно лезут, но работает.
и на облако часть данных тоже синхронится, аккурат для бекапа. точнее на несколько облак в «различных политических регионах земли». тут рклоун рулит.
тар посоветую отправить по стиксу вниз, уж слишком древний енто ткаменный топорик, имхо конечно же :)
обмазаться защитными системами можно по самые гланды, но вот неудобно жить в такой клетке, опять же имхо конечно же.

pfg ★★★★★
()
Ответ на: комментарий от VIT

Нифига не намеренно они появились. Я не знаю как там в США или где ты там находишься, а в РФ и очень хорошо помню как стало проще, когда не надо стало таскать с собой флешку/дискету (да я помню когда дискету таскали и таскал её до флешки). Теперь красота - даже большой архив можно передать, что в случае почты часто ограничивается и ограничивалось. Я так готовые виртуалки студентам раздавал к примеру, где уже нужный софт для занятия весь стоял и настроен был. В том числе тем, кто не мог приехать на пару, например болея или просто прогуливая. Понятно что студентам с картошка-пекичем приходилось в универ ножками идти и там всё делать (и таких на самом деле процентов 10 в Москве на айтишных факультетах). Без облаков мне пришлось бы торрент разворачивать, а с этим мороки больше.

peregrine ★★★★★
()
Ответ на: комментарий от peregrine

Нифига не намеренно они появились. Я не знаю как там в США или где ты там находишься

Я вам говорю как человек, имеющий к появлению этих облак прямое отношение. И афоризм «если что-то даётся бесплатно, значит товар - ты» появился не на пустом месте.

VIT ★★★
()
Ответ на: комментарий от VIT

Посмотрел, не понятно что нового. Количество дебилов в России работало точно также и куда раньше. Называется поисковая бомба, яндекс когда-то показывал по этому запросу главную ВК, где было написано сколько там людей зарегистрировалось. Теперь альфачи и поздние зумеры для себя открыли то что было известно всем миллениалам. Мне удивительно, что вы этого не знаете, вроде очень старый аккаунт. Неужели в США этого не было? Или там цензоры активнее работали, не допуская такой лажи?

peregrine ★★★★★
()
Последнее исправление: peregrine (всего исправлений: 1)
Ответ на: комментарий от VIT

Верю. Но данные там не столько для ИИ собирали (в 2010-ых когда облака пошли в ИИ ещё толком не верили, прорыв в виде глубокого обучения это 2014, а дошло до всех что за ИИ будущее только к ковиду), сколько для нужд полиции, спецслужб, чёрного рынка данных для всяких жуликов. Ну и конечно рекламщики. Они самые заинтересованные. Но их можно к жуликам отнести, пусть и к более-менее легальным.

peregrine ★★★★★
()
Последнее исправление: peregrine (всего исправлений: 3)
Ответ на: комментарий от VIT

думаю что не для краулеров облака и серверную инфраструктуру делали :)
вынос серверов и обслуживания их на аутсорс серъезно удешевляет их пользование при малых объемах серверных потребностей.

pfg ★★★★★
()
Для того чтобы оставить комментарий войдите или зарегистрируйтесь.