<?xml version="1.0" encoding="UTF-8"?>
<article xmlns:xlink="http://www.w3.org/1999/xlink" xmlns:xsi="http://www.w3.org/2001/XMLSchema-instance" xsi:noNamespaceSchemaLocation="JATS-archive-oasis-article1-4.xsd" article-type="research-article" dtd-version="1.4" xml:lang="ru">
  <front>
    <journal-meta>
      <journal-title-group>
        <journal-title>Журнал Научное обозрение. Технические науки</journal-title>
      </journal-title-group>
      <issn>2500-0799</issn>
      <publisher>
        <publisher-name>Общество с ограниченной ответственностью &amp;quot;Издательский Дом &amp;quot;Академия Естествознания&amp;quot;</publisher-name>
      </publisher>
    </journal-meta>
    <article-meta>
      <article-id pub-id-type="publisher-id">ART-1205</article-id>
      <title-group>
        <article-title>ОПРЕДЕЛЕНИЕ АВТОРСТВА ТЕКСТОВ НА ОСНОВЕ ПОДХОДА N-ГРАММ</article-title>
      </title-group>
      <contrib-group>
        <contrib contrib-type="author">
          <name-alternatives>
            <name xml:lang="ru">
              <surname>Леонова</surname>
              <given-names>А.В.</given-names>
            </name>
          </name-alternatives>
          <name-alternatives>
            <name xml:lang="en">
              <surname>Leonova</surname>
              <given-names>A.V.</given-names>
            </name>
          </name-alternatives>
          <email>aniliar@mail.ru</email>
          <xref ref-type="aff" rid="aff7f78b08f"/>
        </contrib>
        <contrib contrib-type="author">
          <name-alternatives>
            <name xml:lang="ru">
              <surname>Леонова</surname>
              <given-names>И.В.</given-names>
            </name>
          </name-alternatives>
          <name-alternatives>
            <name xml:lang="en">
              <surname>Leonova</surname>
              <given-names>I.V.</given-names>
            </name>
          </name-alternatives>
          <email>irileonova@mail.ru</email>
          <xref ref-type="aff" rid="aff0a9a275f"/>
        </contrib>
      </contrib-group>
      <aff id="aff7f78b08f">
        <institution xml:lang="ru">Санкт-Петербургский государственный университет</institution>
        <institution xml:lang="en">Saint Petersburg State University</institution>
      </aff>
      <aff id="aff0a9a275f">
        <institution xml:lang="ru">Краснодарское высшее военное авиационное училище летчиков имени Героя Советского Союза А.К. Серова</institution>
        <institution xml:lang="en">Krasnodar Air Force Academy named after the Hero of the Soviet Union A.K. Serov</institution>
      </aff>
      <pub-date date-type="pub" iso-8601-date="2018-06-01">
        <day>01</day>
        <month>06</month>
        <year>2018</year>
      </pub-date>
      <issue>6</issue>
      <fpage>37</fpage>
      <lpage>40</lpage>
      <permissions>
        <license xlink:href="https://creativecommons.org/licenses/by/4.0/">
          <license-p>This is an open-access article distributed under the terms of the CC BY 4.0 license.</license-p>
        </license>
      </permissions>
      <self-uri content-type="url" hreflang="ru">https://science-engineering.ru/ru/article/view?id=1205</self-uri>
      <abstract xml:lang="ru" lang-variant="original" lang-source="author">
        <p>Статья знакомит с исследованием в области автоматизации определения авторства текстов. Выделяются и описываются характерные особенности методов и подходов решения задачи атрибуции. Эти методы делятся на два принципиально разных подхода: экспертный и формальный. При реализации экспертного подхода исследование текста осуществляется экспертом-лингвистом и во многом зависит от информации об авторе, которая содержится в самом тексте, а также от уровня квалификации специалиста. Поэтому он носит субъективный характер. При формальном подходе к решению задачи атрибуции используется статистический анализ и машинное обучение. В связи с этим формальный подход имеет объективный характер, что обусловливает актуальность его развития на базе современных информационных технологий. Актуальность статьи состоит в предложенном методе решения современной задачи определения авторства текстов, в котором особое внимание акцентируется на изучении подхода N-грамм. Цель исследования заключается в проведении детального анализа сценария полной кластеризации авторства. Методом исследования стал подход N-грамм, который имеет большую область применения: от теоретической математики до музыки. Используемый подход является простым, эффективным, не требующим сложной предварительной обработки входного текста и допускающим орфографические, грамматические ошибки. Автором выбрано восемь текстов на русском языке, которые подготовлены к использованию и преобразованы согласно условиям поставленной задачи, а также представлен алгоритм и анонсирована компьютерная программа, позволяющая автоматизировать решение задачи атрибуции текстов. Проведенное исследование позволило разработать авторские профили на основе N-грамм, создать коллекцию известных писателей, автоматизировать процедуру определения авторства текстов. Апробация разработанной компьютерной программы атрибуции текстов показала положительный результат.</p>
      </abstract>
      <abstract xml:lang="en" lang-variant="translation" lang-source="translator">
        <p>The article introduces the research in the field of automation of determining the authorship of texts. Allocated and describes the characteristics of the methods and approaches of solving the problem of attribution. These methods are divided into two fundamentally different approaches: expert and formal. In the implementation of the expert approach, the study of the text is carried out by an expert linguist and largely depends on the information about the author, which is contained in the text itself, as well as on the level of qualification of the specialist. Therefore, it is subjective. The formal approach to the attribution problem uses statistical analysis and machine learning. In this regard, the formal approach is objective, which determines the relevance of its development on the basis of modern information technologies. The relevance of the article is in the proposed method of solving the modern problem of determining the authorship of texts, which focuses on the study of the approach of N-grams. The purpose of the study is to conduct a detailed analysis of the scenario of full clustering of authorship. The method of research was the approach of N-grams, which has a large field of application: from theoretical mathematics to music. The approach used is simple, effective, does not require complex pre-processing of the input text and allows spelling, grammatical errors. The author has chosen eight texts in Russian, which are prepared for use and converted according to the conditions of the task, as well as the algorithm and announced a computer program that allows you to automate the solution of the problem of attribution of texts. The conducted research allowed to develop author’s profiles on the basis of N-grams, to create a collection of famous writers, to automate the procedure of determining the authorship of texts. Testing of the developed computer program of text attribution showed a positive result.</p>
      </abstract>
      <kwd-group xml:lang="ru">
        <kwd>алгоритм</kwd>
        <kwd>компьютерная программа</kwd>
        <kwd>кластеризация</kwd>
        <kwd>классификация</kwd>
        <kwd>подход N-грамм</kwd>
        <kwd>задача атрибуции</kwd>
      </kwd-group>
      <kwd-group xml:lang="en">
        <kwd>algorithm</kwd>
        <kwd>computer program</kwd>
        <kwd>clusterization</kwd>
        <kwd>classification</kwd>
        <kwd>N-gram approach</kwd>
        <kwd>attribution problem</kwd>
      </kwd-group>
    </article-meta>
  </front>
  <back>
    <ref-list>
      <ref>
        <note>
          <p>1. Лингвистическая безопасность речевой коммуникации // ГЛЭДИС. 2004 [Электронный ресурс]. URL: http://www.rusexpert.ru/magazine/034.htm (дата обращения: 22.11.2018).</p>
        </note>
      </ref>
      <ref>
        <note>
          <p>2. Виноградов В.В. Лингвистические основы научной критики текста // Вопросы языкознания. 1958. № 2. С. 3.</p>
        </note>
      </ref>
      <ref>
        <note>
          <p>3. Батура Т.В. Формальные методы определения авторства текстов // Вестник НГУ. Серия: Информационные технологии. 2012. Т. 10. вып. 4. С. 81–94.</p>
        </note>
      </ref>
      <ref>
        <note>
          <p>4. Diurdeva P., Mikhailova E., Shalymov D. Writer identification based on letter frequency distribution. Open Innovations Association (FRUCT), 2016 19th Conference of. IEEE, 2016. Р. 24–30.</p>
        </note>
      </ref>
      <ref>
        <note>
          <p>5. Stamatatos E.A. Survey of modern authorship attribution methods. Journal of the American Society for information Science and Technology. 2009. Т. 60. № 3. Р. 538–556.</p>
        </note>
      </ref>
      <ref>
        <note>
          <p>6. Борисов Л.А., Орлов Ю.Н., Осминин К.П. Идентификация автора текста по распределению частот буквосочетаний // Препринты Института прикладной математики им. М.В. Келдыша РАН. 2013. № 27. С. 27–26.</p>
        </note>
      </ref>
      <ref>
        <note>
          <p>7. Суркова А.С. Идентификация авторства текстов на основе информационных портретов // Вестник Нижегородского университета им. Н.И. Лобачевского. 2014. № 3 (1). С. 145–149.</p>
        </note>
      </ref>
    </ref-list>
  </back>
</article>
