<?xml version="1.0" encoding="UTF-8"?>
<article xmlns:xlink="http://www.w3.org/1999/xlink" xmlns:xsi="http://www.w3.org/2001/XMLSchema-instance" xsi:noNamespaceSchemaLocation="JATS-archive-oasis-article1-4.xsd" article-type="research-article" dtd-version="1.4" xml:lang="ru">
  <front>
    <journal-meta>
      <journal-title-group>
        <journal-title>Журнал Научное обозрение. Технические науки</journal-title>
      </journal-title-group>
      <issn>2500-0799</issn>
      <publisher>
        <publisher-name>Общество с ограниченной ответственностью &amp;quot;Издательский Дом &amp;quot;Академия Естествознания&amp;quot;</publisher-name>
      </publisher>
    </journal-meta>
    <article-meta>
      <article-id pub-id-type="publisher-id">ART-1170</article-id>
      <title-group>
        <article-title>ИСПОЛЬЗОВАНИЕ МОДЕЛИ WORD2VEC ДЛЯ КЛАСТЕРИЗАЦИИ БОЛЬШИХ ТЕКСТОВЫХ ДАННЫХ</article-title>
      </title-group>
      <contrib-group>
        <contrib contrib-type="author">
          <name-alternatives>
            <name xml:lang="ru">
              <surname>Черепков</surname>
              <given-names>Е.А.</given-names>
            </name>
          </name-alternatives>
          <name-alternatives>
            <name xml:lang="en">
              <surname>Cherepkov</surname>
              <given-names>E.A.</given-names>
            </name>
          </name-alternatives>
          <email>e.cherepkov@ya.ru</email>
          <xref ref-type="aff" rid="aff26072cb8"/>
        </contrib>
        <contrib contrib-type="author">
          <name-alternatives>
            <name xml:lang="ru">
              <surname>Глебов</surname>
              <given-names>С.А.</given-names>
            </name>
          </name-alternatives>
          <name-alternatives>
            <name xml:lang="en">
              <surname>Glebov</surname>
              <given-names>S.A.</given-names>
            </name>
          </name-alternatives>
          <email>e.cherepkov@ya.ru</email>
          <xref ref-type="aff" rid="aff26072cb8"/>
        </contrib>
      </contrib-group>
      <aff id="aff26072cb8">
        <institution xml:lang="ru">Калужский филиал ФГБОУ ВО «Московский государственный технический университет имени Н.Э. Баумана (национальный исследовательский университет)»</institution>
        <institution xml:lang="en">Kaluga branch of the Federal State Budget Education Institution оf Higher Education «Moscow State Technical University named after N.E. Bauman (National Research University)»</institution>
      </aff>
      <pub-date date-type="pub" iso-8601-date="2017-03-13">
        <day>13</day>
        <month>03</month>
        <year>2017</year>
      </pub-date>
      <issue>3</issue>
      <fpage>21</fpage>
      <lpage>24</lpage>
      <permissions>
        <license xlink:href="https://creativecommons.org/licenses/by/4.0/">
          <license-p>This is an open-access article distributed under the terms of the CC BY 4.0 license.</license-p>
        </license>
      </permissions>
      <self-uri content-type="url" hreflang="ru">https://science-engineering.ru/ru/article/view?id=1170</self-uri>
      <abstract xml:lang="ru" lang-variant="original" lang-source="author">
        <p>В данной статье приведен вариант использования модели Word2Vec и алгоритма k-means для кластеризации большого количества текстовой информации. Рассмотрены основные этапы работы модели: подготовка данных, генерация векторов слов и кластеризация слов. На этапе генерации векторов слов для обучения модели используется набор данных 20 Newsgroups data set. Для генерации используется модель Skip-gram. Для кластеризации используется алгоритм K-means, который разбивает N элементов на K-кластеров. Далее оценивается производительность модели и эффективность классификации, при помощи показателя F1-micro и времени работы алгоритма. На основе полученных результатов был сделан вывод о том, что модель Word2Vec успешно справляется с поиском семантически связанных слов и в результате получаются правильные кластеры.</p>
      </abstract>
      <abstract xml:lang="en" lang-variant="translation" lang-source="translator">
        <p>This article describes the use Word2Vec model and k-means algorithm for clustering large amount of textual information. Describes the main stages of the model: data preparation, generation of words vectors and clustering words. At the stage of generation of word vectors for learning the model, the data set 20 Newsgroups data set is used. To generate the model is used Skip-gram. For clustering, the K-means algorithm is used, which splits N elements into K-clusters. Further, the model performance and classification efficiency are estimated using the F1-micro indicator and the algorithm running time. Based on the results obtained, it was concluded that the Word2Vec model successfully copes with the search for semantically related words, and as a result, the right clusters are obtained.</p>
      </abstract>
      <kwd-group xml:lang="ru">
        <kwd>большие данные</kwd>
        <kwd>Word2Vec</kwd>
        <kwd>кластеризация</kwd>
        <kwd>k-means</kwd>
      </kwd-group>
      <kwd-group xml:lang="en">
        <kwd>big data</kwd>
        <kwd>Word2Vec</kwd>
        <kwd>clustering</kwd>
        <kwd>k-means</kwd>
      </kwd-group>
    </article-meta>
  </front>
  <back>
    <ref-list>
      <ref>
        <note>
          <p>1. Mayer-Schonberger V. Big data: A revolution that will transform how we live, work, and think / V. Mayer-Schonberger, K. Cukier. – Houghton Mifflin Harcourt, 2013. – 242 p.</p>
        </note>
      </ref>
      <ref>
        <note>
          <p>2. Аксютина Е.М., Белов Ю.С., Обзор архитектур и методов машинного обучения для анализа больших данных // Электронный журнал: наука, техника и образование. – 2016. – № 1 (5). – С. 134–141.</p>
        </note>
      </ref>
      <ref>
        <note>
          <p>3. Аксютина Е.М., Белов Ю.С. Анализ оптимизированного алгоритма выравнивания биологических последовательностей // Электронный журнал: наука, техника и образование. – 2017. – № 2 (12). – С. 100–106.</p>
        </note>
      </ref>
      <ref>
        <note>
          <p>4. Васильчикова А.В., Ткаченко А.В., Гришунов С.С. Обзор классов нереляционных баз данных // Электронный журнал: наука, техника и образование. – 2016. – № 4 (9). – С. 81–85.</p>
        </note>
      </ref>
      <ref>
        <note>
          <p>5. Нифонтов С.В., Белов Ю.С. Применение вейвлет- анализа и нейронных сетей в системах распознавания дикторов // Информационные технологии в науке нового времени: сборник статей Международной научно-практической конференции. – 2016. – С. 41–45.</p>
        </note>
      </ref>
      <ref>
        <note>
          <p>6. Mikolov T., Chen K., Corrado G., Dean J. Efficient Estimation of Word Representations in Vector Space // Proc. Workshop at ICLR. – 2013.</p>
        </note>
      </ref>
      <ref>
        <note>
          <p>7. Mikolov T., Sutskever I., Chen K., Corrado G., Dean J., Distributed Representations of Words and Phrases and their Compositionality // Proc. NIPS. – 2013.</p>
        </note>
      </ref>
      <ref>
        <note>
          <p>8. Mikolov T., Yih W., Zweig G., Linguistic Regularities in Continuous Space Word Representations // Proc. NAACL HLT. – 2013.</p>
        </note>
      </ref>
      <ref>
        <note>
          <p>9. Wu J. Advances in K-means Clustering: A Data Mining Thinking (Springer Theses: Recognizing Outstanding Ph.D. Research) / J. Wu. – Springer. – 2012. – 180 p.</p>
        </note>
      </ref>
      <ref>
        <note>
          <p>10. Lang K., 20 newsgroup data set [Электронный ресурс]. – URL: http://qwone.com/~jason/20Newsgroups/ (дата обращения: 17.10.17).</p>
        </note>
      </ref>
      <ref>
        <note>
          <p>11. Гришанов К.М., Белов Ю.С. Метод классификации k – nn и его применение в распознавании символов // Фундаментальные проблемы науки: сборник статей Международной научно-практической конференции. – 2016. – С. 30–33.</p>
        </note>
      </ref>
      <ref>
        <note>
          <p>12. Allen G. Vector quantization and signal compression / G. Allen, R.M. Gray. – Springer Science &amp; Business Media. – 2012. – vol. 159. – 732 p.</p>
        </note>
      </ref>
      <ref>
        <note>
          <p>13. Pedregosa F. Scikit-learn: Machine Learning in Python // JMLR 12. – 2011. – Р. 2825–2830.</p>
        </note>
      </ref>
      <ref>
        <note>
          <p>14. Long Ma, Yanqing Zhang. Using Word2Vec to process big text data // Big Data (Big Data), IEEE International Conference. – 2015.</p>
        </note>
      </ref>
      <ref>
        <note>
          <p>15. Sebastiani F. Machine learning in automated text categorization // ACM Computing Surveys. – 2002. – № 34 (1). – Р. 1–47.</p>
        </note>
      </ref>
    </ref-list>
  </back>
</article>
