<?xml version="1.0" encoding="UTF-8"?>
<article xmlns:xlink="http://www.w3.org/1999/xlink" xmlns:xsi="http://www.w3.org/2001/XMLSchema-instance" xsi:noNamespaceSchemaLocation="JATS-archive-oasis-article1-4.xsd" article-type="research-article" dtd-version="1.4" xml:lang="ru">
  <front>
    <journal-meta>
      <journal-title-group>
        <journal-title>Журнал Научное обозрение. Технические науки</journal-title>
      </journal-title-group>
      <issn>2500-0799</issn>
      <publisher>
        <publisher-name>Общество с ограниченной ответственностью &amp;quot;Издательский Дом &amp;quot;Академия Естествознания&amp;quot;</publisher-name>
      </publisher>
    </journal-meta>
    <article-meta>
      <article-id pub-id-type="doi">10.17513/srts.1391</article-id>
      <article-id pub-id-type="publisher-id">ART-1391</article-id>
      <title-group>
        <article-title>ПРЕДВАРИТЕЛЬНАЯ ОБРАБОТКА ДАННЫХ ДЛЯ МАШИННОГО ОБУЧЕНИЯ</article-title>
      </title-group>
      <contrib-group>
        <contrib contrib-type="author">
          <name-alternatives>
            <name xml:lang="ru">
              <surname>Акимов</surname>
              <given-names>А.А.</given-names>
            </name>
          </name-alternatives>
          <name-alternatives>
            <name xml:lang="en">
              <surname>Akimov</surname>
              <given-names>A.A.</given-names>
            </name>
          </name-alternatives>
          <email>a.a.akimov@strbsu.ru</email>
          <xref ref-type="aff" rid="affed8947bc"/>
        </contrib>
        <contrib contrib-type="author">
          <name-alternatives>
            <name xml:lang="ru">
              <surname>Валитов</surname>
              <given-names>Д.Р.</given-names>
            </name>
          </name-alternatives>
          <name-alternatives>
            <name xml:lang="en">
              <surname>Valitov</surname>
              <given-names>D.R.</given-names>
            </name>
          </name-alternatives>
          <email>deniska1704@gmail.com</email>
          <xref ref-type="aff" rid="affed8947bc"/>
        </contrib>
        <contrib contrib-type="author">
          <name-alternatives>
            <name xml:lang="ru">
              <surname>Кубряк</surname>
              <given-names>А.И.</given-names>
            </name>
          </name-alternatives>
          <name-alternatives>
            <name xml:lang="en">
              <surname>Kubryak</surname>
              <given-names>A.I.</given-names>
            </name>
          </name-alternatives>
          <email>falcone.kub@gmail.com</email>
          <xref ref-type="aff" rid="affed8947bc"/>
        </contrib>
      </contrib-group>
      <aff id="affed8947bc">
        <institution xml:lang="ru">Стерлитамакский филиал Башкирского государственного университета</institution>
        <institution xml:lang="en">Sterlitamak branch of the Bashkir State University</institution>
      </aff>
      <pub-date date-type="pub" iso-8601-date="2022-02-05">
        <day>05</day>
        <month>02</month>
        <year>2022</year>
      </pub-date>
      <issue>2</issue>
      <fpage>26</fpage>
      <lpage>31</lpage>
      <permissions>
        <license xlink:href="https://creativecommons.org/licenses/by/4.0/">
          <license-p>This is an open-access article distributed under the terms of the CC BY 4.0 license.</license-p>
        </license>
      </permissions>
      <self-uri content-type="url" hreflang="ru">https://science-engineering.ru/ru/article/view?id=1391</self-uri>
      <abstract xml:lang="ru" lang-variant="original" lang-source="author">
        <p>Данные – это не что иное, как актив в современном мире. Данные в настоящее время сильно искажены несоответствиями, шумом, неполной информацией и пропущенными значениями. Они агрегируются из разнообразных источников с использованием методов интеллектуального анализа данных и хранилищ. Предварительная обработка данных служит основой для достоверного анализа. Это необходимый шаг в построении анализа оперативных данных, учитывая недостатки в их качестве. Также предобработка относится к основному набору методов для повышения качества исходных данных, таких как очистка, нормализация, отбор необходимых признаков и экземпляров. Так как полученные данные представлены в необработанном виде, обучение модели с их использованием может оказаться недостижимым. Эта статья представляет собой обзор методов предварительной обработки для анализа используемых данных. Также в ней рассмотрены этапы предварительной обработки данных, изучены виды признаков в машинном обучении, произведен обзор категориальных переменных. Продемонстрированы пять этапов предобработки данных, рассмотрены виды признаков при обработке данных для машинного обучения, описаны категориальные признаки и приведены два вида примеров категориальных переменных.</p>
      </abstract>
      <abstract xml:lang="en" lang-variant="translation" lang-source="translator">
        <p>Data is nothing but an asset in the modern world. The data is currently heavily distorted by inconsistencies, noise, incomplete information and missing values. They are aggregated from a variety of sources using data mining and storage methods. Preliminary data processing serves as the basis for reliable analysis. This is a necessary step in building an analysis of operational data, given the shortcomings in their quality. Also, preprocessing refers to the main set of methods to improve the quality of the source data, such as cleaning, normalization, selection of necessary features and instances. Since the data obtained is presented in raw form, training the model using them may not be achievable. This article is an overview of preprocessing methods for analyzing the data used. The stages of data preprocessing are also considered, the types of features in machine learning are studied, and a review of categorical variables is made. Five stages of data preprocessing are demonstrated, the types of features in data processing for machine learning are considered, categorical features are described and two types of examples of categorical variables are given.</p>
      </abstract>
      <kwd-group xml:lang="ru">
        <kwd>данные</kwd>
        <kwd>обработка</kwd>
        <kwd>категориальные переменные</kwd>
        <kwd>генерация признаков</kwd>
        <kwd>очистка данных</kwd>
      </kwd-group>
      <kwd-group xml:lang="en">
        <kwd>data</kwd>
        <kwd>processing</kwd>
        <kwd>categorical variables</kwd>
        <kwd>feature generation</kwd>
        <kwd>data cleaning</kwd>
      </kwd-group>
    </article-meta>
  </front>
  <back>
    <ref-list>
      <ref>
        <note>
          <p>1. Быков К.В. Особенности предобработки данных для применения машинного обучения // Молодой ученый. 2021. № 53 (395). С. 1-4. [Электронный ресурс]. URL: https://moluch.ru/archive/395/87491/ (дата обращения: 22.04.2022).</p>
        </note>
      </ref>
      <ref>
        <note>
          <p>2. Флах П. Машинное обучение. Наука и искусство построения алгоритмов, которые извлекают знания из данных. М.: ДМК Пресс, 2015. 400 с.</p>
        </note>
      </ref>
      <ref>
        <note>
          <p>3. Близнюк Б., Васильева Л., Стрельников П., Ткачук Д. Современные методы обработки естественного языка // Вестник Харьковского национального университета им. Каразина. Серия «Математическое моделирование. Информационные технологии. Автоматизированные системы управления». 2017. № 36. С. 14-26.</p>
        </note>
      </ref>
      <ref>
        <note>
          <p>4. Kumar D. Introduction to Data Preprocessing in Machine Learning. [Электронный ресурс]. URL: https://towardsdatascience.com/introduction-to-data-preprocessing-in-machine-learning-a9fa83a5dc9d (дата обращения: 22.04.2022).</p>
        </note>
      </ref>
      <ref>
        <note>
          <p>5. Акимов А.А., Мустафина С.А. Обзор современных методов искусственного интеллекта по распознаванию девиантного поведения индивида // Вестник Технологического университета. 2020. Т. 23. № 8. С. 69-79.</p>
        </note>
      </ref>
      <ref>
        <note>
          <p>6. Mustafina S., Akimov A., Plotnikova A. Сomparison of semantic convolution neural networks on the example of crack segmentation in asphalt images. International Journal of Computing. 2021. Т. 19. № 3. С. 415-423.</p>
        </note>
      </ref>
      <ref>
        <note>
          <p>7. Hamza A. Effective Data Preprocessing and Feature Engineering. [Электронный ресурс]. URL: https://becominghuman.ai/effective-data-preprocessing-and-feature-engineering-452d3a948262 (дата обращения: 22.04.2022).</p>
        </note>
      </ref>
    </ref-list>
  </back>
</article>
