Есть два HTML-кода. В одном - статья на одном сайте, в другом - копия этой статьи на другом сайте, прошедшая некие html/xml преобразования. То есть, до и после текста статьи - все в коде разное (header/bottom), да и сам текст статьи на разных сайтах отформатирован разными тегами. И еще текст статьи тоже может немного отличаться.
Так вот, есть ли какая-то консольная утилита, которая покажет некую метрику, через которую можно (хотя бы с некоторой долей вероятности) понять, что эти два HTML-кода содержат одинаковую статью? Или что один HTML-код содержит часть статьи (достаточно крупную) с другой страницы?
Чтобы в утилите была какая-то реализация string kernels или там косинусного подобия или чего-то такого.

Ответ на:
комментарий
от Irma

Ответ на:
комментарий
от Xintrea
Ответ на:
комментарий
от Xintrea

Ответ на:
комментарий
от Ygor
Ответ на:
комментарий
от Shushundr

Ответ на:
комментарий
от CrX

Ответ на:
комментарий
от anonymous

Ответ на:
комментарий
от anonymous

Ответ на:
комментарий
от dataman

Ответ на:
комментарий
от rtxtxtrx

Ответ на:
комментарий
от Xintrea

Ответ на:
комментарий
от Ygor


Ответ на:
комментарий
от dataman

Ответ на:
комментарий
от anonymous

Ответ на:
комментарий
от Shushundr
Ответ на:
комментарий
от rtxtxtrx

Ответ на:
комментарий
от Xintrea

Ответ на:
комментарий
от Shadow
Вы не можете добавлять комментарии в эту тему: топик перемещен в архив.