Перевести запись разговора в текст задача не только для журналиста: диктофон сегодня носит в кармане и врач, и юрист, и студент, и руководитель отдела. Слушать час записи ради двух абзацев выводов занятие неблагодарное, поэтому подборка сервисов расшифровки аудио в текст собрана для тех, кто хочет получить готовый документ за минуты, а не за вечер.
Смотрели на то, что важно в работе: качество распознавания русской речи, умение расставлять пунктуацию и делить реплики по говорящим, поддержку длинных файлов, наличие таймкодов и редактора. Отдельно учитывали цену за минуту и порог входа: одним нужен готовый сайт с кнопкой "загрузить", другим API и возможность поставить движок в свой контур, третьим бесплатный офлайн-вариант, который не отправляет запись наружу. Российские платформы шли первыми, глобальные добирали там, где они реально доступны.
Места в списке расставляют голоса читателей, редакция только собрала участников и проверила факты. В карточках указаны плюсы, минусы и практические ограничения, так что перед выбором стоит прочитать не только верхние строчки, но и отзывы тех, кто уже загружал свои записи в эти сервисы расшифровки аудио в текст.
Речевой сервис в составе Yandex Cloud: распознаёт аудио в потоке и пакетно, отдельным API обрабатывает длинные записи, ставит знаки препинания, нормализует числа и даты, умеет разделять реплики по говорящим. Русский язык основной, поддерживаются и другие. Тарификация посекундная, стоимость считается за 15-секундные блоки, для новых аккаунтов есть пробный период и стартовый грант. Оплата в рублях, договор и закрывающие документы для юрлиц оформляются обычным порядком.
Подходит тем, у кого расшифровка часть системы: колл-центрам, аналитикам звонков, разработчикам голосовых помощников. Для человека, которому нужно разово перевести часовое интервью, порог высоковат: придётся завести облачный аккаунт, получить ключ и работать через API или консоль. Готового редактора текста с таймкодами внутри нет, его собирают сами.
Речевая платформа SberDevices, доступная через портал для разработчиков Сбера. Переводит аудио в текст в файловом и потоковом режиме, разделяет говорящих, нормализует числа, работает вместе с синтезом речи, а для крупных заказчиков поставляется и в закрытый контур. Для знакомства выдаётся бесплатный пакет, дальше тарифы считаются по объёму распознанного звука; оплата рублёвая, документы российские.
Логичный выбор для компаний, которые уже живут в экосистеме Сбера и обрабатывают потоки звонков или обращений. Частному пользователю сервис покажется тяжеловатым: нужен Sber ID, регистрация проекта и работа с API, а без юрлица доступны не все возможности. Зато к русской речи, отраслевой лексике и телефонному качеству звука движок относится терпимо.
Российский онлайн-сервис для транскрибации аудио и видео. Файл загружается на сайт или пересылается телеграм-боту, на выходе получается текст с таймкодами и разбивкой по спикерам, а к нему краткое содержание встречи. Есть встроенный редактор, где можно поправить распознанное, слушая запись, поддерживаются русский и английский. Тарификация поминутная, стартует примерно от 6 рублей за минуту, оплата российскими картами.
Удобен журналистам, исследователям, подкастерам и всем, кому расшифровка нужна регулярно, но программировать неохота. Если запись сделана в шумном кафе или говорят вперебивку, править придётся много: чудес не бывает, но и вручную набирать час звука уже не нужно. Для разовой короткой заметки проще воспользоваться бесплатным голосовым вводом.
Голосовой блокнот, который живёт в сети больше десяти лет и до сих пор выручает. Основной режим бесплатный: текст диктуется в браузере Chrome, пунктуация ставится голосовыми командами, есть расширение для ввода прямо в поля на сайтах и мобильное приложение. Отдельно доступен перевод готовых аудио и видеофайлов в текст, эта часть работает по платному тарифу.
Хороший вариант для тех, кому надо надиктовать заметку, письмо или черновик статьи, не тратя ни рубля. Требования простые, но жёсткие: браузер Chrome и микрофон поприличнее. Интерфейс выглядит по-старомодному, разделения по говорящим и таймкодов нет, поэтому для расшифровки многочасового совещания на несколько участников сервис не годится.
Платформа распознавания и синтеза речи от MTS AI. Умеет синхронное и потоковое распознавание, обрабатывает файлы целиком, определяет эмоции говорящего, дополняется модулем синтеза. Ставится в контур заказчика, что важно для банков, страховых и медицины, где запись разговора наружу отдавать нельзя. Документация и инструкции по развёртыванию опубликованы открыто на GitHub.
Продукт корпоративный: цену считают под задачу и объём, самостоятельно оформить подписку на пару часов записей не выйдет. Зато для контакт-центра с тысячами звонков в сутки такой подход выгоднее поминутной оплаты. Частному пользователю сюда идти незачем, а вот интегратору или ИТ-отделу крупной компании платформу есть смысл рассмотреть.
Центр речевых технологий занимается распознаванием речи с начала девяностых, задолго до нынешней моды на нейросети. В линейке решения для контакт-центров и речевой аналитики, системы протоколирования совещаний, экспертиза фонограмм для криминалистики и медицинская диктовка Voice2Med, которая заполняет протоколы осмотров под голос врача.
Работает проектно: внедрение обсуждается с менеджером, система обычно разворачивается на серверах заказчика, а не в облаке. Такой формат оправдан там, где записи нельзя выпускать за периметр, например в клиниках и госструктурах. Для блогера или студента вариант избыточный: ни быстрой регистрации, ни оплаты картой за пару часов расшифровки тут нет.
Открытая библиотека офлайн-распознавания речи от команды Alphacephei. Модели существуют для двух десятков языков, включая русский; компактные версии весят около 50 мегабайт и запускаются даже на одноплатном компьютере или смартфоне. Лицензия Apache 2.0, есть привязки для Python, Java, C#, Node.js, работа полностью без интернета.
Главная ценность в приватности и нулевой стоимости: запись не покидает устройство, платить не нужно ни за минуту, ни за месяц. Расплата за это точность: маленькие модели ошибаются заметно чаще облачных, пунктуацию и разбивку по говорящим приходится добавлять отдельно. Без базовых навыков программирования подступиться сложно, готового сайта с кнопкой загрузки у проекта нет.
Открытая модель распознавания речи, выложенная в сентябре 2022 года и с тех пор ставшая основой для десятков сторонних приложений. Обучена почти на ста языках, русский держит уверенно, умеет заодно переводить речь на английский. Версии от tiny до large позволяют выбрать баланс скорости и качества, код и веса свободно доступны, платить за использование не нужно.
Запускается на своём компьютере, поэтому запись никуда не уходит, что ценно для врачебных и юридических материалов. Нюансы известны: без видеокарты большие модели считают долго, на паузах и шуме модель иногда дописывает то, чего не было, разделения по говорящим нет. Проще всего использовать через готовые оболочки, самостоятельная установка потребует терпения.
Онлайн-сервис и мобильное приложение для расшифровки записей и встреч. Поддерживает больше пятидесяти языков, включая русский, подключается к Zoom, Google Meet и Teams, чтобы вести конспект прямо во время созвона, делает саммари и выгружает результат в текстовые файлы и субтитры. Есть бесплатный тариф с лимитом минут и платные подписки с длинными файлами и переводом.
Полезен тем, кто много созванивается с иностранными коллегами и ведёт заметки на нескольких языках. Из России пользоваться сложнее: оплата картой зарубежная, часть интерфейса переведена машинно, а бесплатного лимита хватает буквально на несколько встреч. Для длинных русскоязычных интервью выгоднее посмотреть на локальные сервисы с поминутной оплатой.