НОВЫЙ МЕТОД СТИЛЕМЕТРИИ НА ОСНОВЕ СТАТИСТИКИ ЧИСЛИТЕЛЬНЫХ

科研成果: Article

摘要

Предложен новый метод статистического анализа текстов. Исследовано распределение частот различных первых значащих цифр в числительных англоязычных текстов. Учитываются количественные и порядковые числительные, выраженные как цифрами, так и словесно. Предварительно из текста удаляются случайно попавшие в него числительные, не отражающие авторский замысел (номера страниц, маркеры списков, идиоматические выражения, устойчивые обороты речи и тому подобное). Обнаружено, что для сборных текстов разного авторства частоты первых значащих цифр приближенно соответствуют известному закону Бенфорда, но с резким преобладанием встречаемости единицы. В связных авторских текстах возникают характерные отклонения от закона Бенфорда; показано, что эти отклонения являются статистически устойчивыми и значимыми авторскими особенностями, позволяющими при определенных условиях ответить на вопрос об авторстве и различить тексты разных авторов. Требуется, чтобы текст был достаточно длинным (не менее чем порядка 200 кБ). Распределение первых значащих цифр конца ряда {1, 2,..., 8, 9} подвержено сильным флуктуациям и не показательно для нашей цели. Цель теоретического обоснования найденной эмпирической закономерности в работе не ставится, но продемонстрировано ее практическое использование для атрибуции текстов. Предлагаемый подход и сделанные выводы подкреплены примерами компьютерного анализа художественных текстов У. М. Теккерея, М. Твена,Р. Л. Стивенсона, Дж. Джойса, сестер Бронте, Дж. Остин. На основе разработанной методологии рассмотрены проблемы авторства текста, ранее приписывавшегося Л. Ф. Бауму (результат согласуется с полученным другими методами), а также известного романа Харпер Ли «Убить пересмешника»; показано, что к написанию первоначального варианта этой книги («Пойди, поставь сторожа») мог быть причастен Трумен Капоте, но финальный текст, вероятно, принадлежит Харпер Ли. Результаты подтверждены на основе параметрического критерия Пирсона, а также непараметрических U-критерия Манна - Уитни и критерия Крускала - Уоллиса.
投稿的翻译标题A novel method of stylometry based on the statistic of numerals
源语言Russian
页(从-至)837-850
页数14
期刊Computer Research and Modeling
9
5
DOI
Published - 1 一月 2017

ASJC Scopus subject areas

  • Computer Science Applications
  • Computational Theory and Mathematics
  • Modelling and Simulation

GRNTI

  • 27.43.00

Level of Research Output

  • VAK List

指纹 探究 'НОВЫЙ МЕТОД СТИЛЕМЕТРИИ НА ОСНОВЕ СТАТИСТИКИ ЧИСЛИТЕЛЬНЫХ' 的科研主题。它们共同构成独一无二的指纹。

引用此