<?xml version="1.0" encoding="UTF-8"?>
<article xmlns:xlink="http://www.w3.org/1999/xlink" xmlns:xsi="http://www.w3.org/2001/XMLSchema-instance" xsi:noNamespaceSchemaLocation="JATS-archive-oasis-article1-4.xsd" article-type="research-article" dtd-version="1.4" xml:lang="ru">
  <front>
    <journal-meta>
      <journal-title-group>
        <journal-title>Журнал Научное обозрение. Технические науки</journal-title>
      </journal-title-group>
      <issn>2500-0799</issn>
      <publisher>
        <publisher-name>Общество с ограниченной ответственностью &amp;quot;Издательский Дом &amp;quot;Академия Естествознания&amp;quot;</publisher-name>
      </publisher>
    </journal-meta>
    <article-meta>
      <article-id pub-id-type="publisher-id">ART-1371</article-id>
      <title-group>
        <article-title>АЛГОРИТМЫ ПРЕОБРАЗОВАНИЯ ТЕКСТА В РЕЧЬ НА ОСНОВЕ РАЗЛИЧНЫХ ФОРМ СИНТЕЗА</article-title>
      </title-group>
      <contrib-group>
        <contrib contrib-type="author">
          <name-alternatives>
            <name xml:lang="ru">
              <surname>Хлопенкова</surname>
              <given-names>А.Ю.</given-names>
            </name>
          </name-alternatives>
          <name-alternatives>
            <name xml:lang="en">
              <surname>Khlopenkova</surname>
              <given-names>A.Y.</given-names>
            </name>
          </name-alternatives>
          <email>fn1-kf@mail.ru</email>
          <xref ref-type="aff" rid="affca7d988b"/>
        </contrib>
        <contrib contrib-type="author">
          <name-alternatives>
            <name xml:lang="ru">
              <surname>Гришунов</surname>
              <given-names>С.С.</given-names>
            </name>
          </name-alternatives>
          <name-alternatives>
            <name xml:lang="en">
              <surname>Grishunov</surname>
              <given-names>S.S.</given-names>
            </name>
          </name-alternatives>
          <email>fn1-kf@mail.ru</email>
          <xref ref-type="aff" rid="affca7d988b"/>
        </contrib>
        <contrib contrib-type="author">
          <name-alternatives>
            <name xml:lang="ru">
              <surname>Белов</surname>
              <given-names>Ю.С.</given-names>
            </name>
          </name-alternatives>
          <name-alternatives>
            <name xml:lang="en">
              <surname>Belov</surname>
              <given-names>Y.S.</given-names>
            </name>
          </name-alternatives>
          <email>fn1-kf@mail.ru</email>
          <xref ref-type="aff" rid="affca7d988b"/>
        </contrib>
      </contrib-group>
      <aff id="affca7d988b">
        <institution xml:lang="ru">Московский государственный технический университет имени Н.Э. Баумана</institution>
        <institution xml:lang="en">Bauman Moscow State Technical University</institution>
      </aff>
      <pub-date date-type="pub" iso-8601-date="2021-05-24">
        <day>24</day>
        <month>05</month>
        <year>2021</year>
      </pub-date>
      <issue>5</issue>
      <fpage>20</fpage>
      <lpage>23</lpage>
      <permissions>
        <license xlink:href="https://creativecommons.org/licenses/by/4.0/">
          <license-p>This is an open-access article distributed under the terms of the CC BY 4.0 license.</license-p>
        </license>
      </permissions>
      <self-uri content-type="url" hreflang="ru">https://science-engineering.ru/ru/article/view?id=1371</self-uri>
      <abstract xml:lang="ru" lang-variant="original" lang-source="author">
        <p>В статье рассматриваются различные существующие методы и алгоритмы синтеза речи. Рассматривается каскадный синтезатор формант, состоящий из последовательно включенных полосовых резонаторов. Описаны методы линейного прогнозирования, предназначенные как для систем кодирования речи, так и для синтеза речи. В статье описаны методы конкатенативного синтеза звука, в которых используется большая база данных исходных звуков, сегментированных на единицы, и алгоритм выбора единиц, который находит единицы, которые лучше всего соответствуют звуку или музыкальной фразе, которую нужно синтезировать, называемой целью. Качество синтезаторов систем TTS оценивается по различным аспектам, включая разборчивость, естественность и предпочтительность синтетической речи, а также факторы человеческого восприятия, такие как грамматическая правильность. В статье описывается недостаток обычного метода линейного прогнозирования, заключающийся в содержании антиформантов. Также поднимается проблема правильного анализа просодии и произношения по письменному тексту. Подчеркивается влияние разработок в области компьютерных наук и искусственного интеллекта на алгоритмы синтезирования речи, которые развивались на протяжении многих лет в ответ на последние тенденции и новые возможности сбора и обработки данных.</p>
      </abstract>
      <abstract xml:lang="en" lang-variant="translation" lang-source="translator">
        <p>Various existing methods and algorithms of speech synthesis are discussed in the article. A cascade formant synthesizer consists of band-pass resonators connected in series is considered. Linear predictive methods, which designed both for speech coding systems and speech synthesis, are described. The article describes concatenative sound synthesis methods, which use a large database of source sounds, segmented into units, and a unit selection algorithm to match best the sound or musical phrase to be synthesised. The quality of TTS system synthesizers is evaluated from different aspects, including intelligibility, naturalness, and preference of the synthetic speech, as well as human perception factors, such as comprehensibility. The article describes the disadvantage of the conventional linear forecasting method, which is the content of antiformants. Also discussed the problem of correct prosody and pronunciation analysis from written text. The influence of developments in Computer Science and AI the approaches to speech synthesis that was evolving through years in response to the recent trends and new possibilities in data collection and processing, is highlighted.</p>
      </abstract>
      <kwd-group xml:lang="ru">
        <kwd>TTS</kwd>
        <kwd>методы PSOLA</kwd>
        <kwd>формантный синтез</kwd>
        <kwd>конкатенативный синтез</kwd>
        <kwd>синусоидальные модели</kwd>
        <kwd>методы</kwd>
        <kwd>основанные на линейном прогнозировании</kwd>
      </kwd-group>
      <kwd-group xml:lang="en">
        <kwd>TTS</kwd>
        <kwd>PSOLA</kwd>
        <kwd>Formant Synthesis</kwd>
        <kwd>Concatenative Synthesis</kwd>
        <kwd>Sinusoidal Models</kwd>
        <kwd>Linear Prediction</kwd>
      </kwd-group>
    </article-meta>
  </front>
  <back>
    <ref-list>
      <ref>
        <note>
          <p>1. Хлопенкова А.Ю., Белов Ю.С. Методы обработки естественного языка в виртуальных голосовых помощниках // Электронное периодическое издание E-Scio. 2019. [Электронный ресурс]. URL: http://e-scio.ru/wp-content/uploads/2019/11/Хлопенкова А.-Ю.-Белов-Ю.-С..pdf (дата обращения: 11.09.2021).</p>
        </note>
      </ref>
      <ref>
        <note>
          <p>2. Takaaki Saeki, Shinnosuke Takamichi, Hiroshi Saruwatari. Incremental Text-to-Speech Synthesis Using Pseudo Lookahead with Large Pretrained Language Model. IEEE Signal Processing Letters. 2020. [Electronic resource]. URL: https://arxiv.org/pdf/2012.12612.pdf (date of access: 11.09.2021).</p>
        </note>
      </ref>
      <ref>
        <note>
          <p>3. Sudoh K., Kano T., Novitasari S., Yanagita T., Sakti S., Nakamura S. Simultaneous speech-to-speech translation system with neural incremental ASR, MT, and TTS. Vol. abs/2011.04845. 2020. [Electronic resource]. URL: https://arxiv.org/abs/2011.04845 (date of access: 11.09.2021).</p>
        </note>
      </ref>
      <ref>
        <note>
          <p>4. Sciforce. Text-to-Speech Synthesis: an Overview. Sciforce. 2020. [Electronic resource]. URL: https://medium.com/sciforce/text-to-speech-synthesis-an-overview-641c18fcd35f (date of access: 11.09.2021).</p>
        </note>
      </ref>
      <ref>
        <note>
          <p>5. Kuligowska K., Kisielewicz P. and Wlodarz A. Speech synthesis systems: disadvantages and limitations. International Journal of Engineering &amp; Technology. 2018. [S.l.]. V. 7. n. 2.28. P. 234–239.</p>
        </note>
      </ref>
      <ref>
        <note>
          <p>6. Simon Robinson, Gary Marsden and Matt Jones. There’s Not an App for That. Morgan Kaufmann. 2015. DOI: 10.1016/C2013-0-00032-1.</p>
        </note>
      </ref>
      <ref>
        <note>
          <p>7. Хлопенкова А.Ю., Белов Ю.С. Подходы компьютерной лингвистики в технологиях работы голосовых помощников // Всероссийская научно-техническая конференция, г. Калуга, КФ МГТУ им. Н.Э. Баумана. 2019. Т. 3. С. 186–188. [Электронный ресурс]. URL: http://conference.bmstu-kaluga.ru/uploads/userfiles/tom3_sek_10_16.pdf (дата обращения: 11.09.2021).</p>
        </note>
      </ref>
    </ref-list>
  </back>
</article>
