Назад
Войти
Whisper и GPT Transcribe от OpenAI — уже на EpicAI

Перевести аудио в текст нейросетью

Загрузите запись интервью, созвона, лекции или подкаста — нейросеть расшифрует речь и вернёт готовый текст с таймкодами и разделением по спикерам. Скачивайте расшифровку в TXT или субтитры в SRT. Без VPN, на русском, оплата картой РФ.

Русская речь без акцента распознавания mp3, wav, m4a, webm, mp4 Экспорт в TXT и SRT
planerka-14-03.mp3 расшифровка готова
00:00 / 00:24 3 спикера · 40 токенов за секунду
00:00
Спикер 1

Итак, коллеги, начнём с итогов недели по продажам, а потом перейдём к плану на март.

00:06
Спикер 2

По выручке мы закрыли квартал на сто двенадцать процентов от плана, отчёт я пришлю сегодня.

00:12
Спикер 1

Отлично. Отдельно нужен разбор по каналу партнёрских продаж там просели заявки.

00:18
Спикер 3

Возьму на себя, к среде подготовлю цифры и сравнение с прошлым кварталом.

TXT SRT

Так выглядит результат: текст, таймкоды и реплики по ролям

Что получите на выходе

Не просто текст, а готовая стенограмма

Нейросеть распознаёт речь целиком, расставляет знаки препинания и приводит расшифровку к виду, с которым можно сразу работать.

Таймкоды

Каждый фрагмент привязан к времени записи. Легко найти нужный момент в часовом созвоне, не переслушивая всё подряд.

Разделение по спикерам

Диалог раскладывается на реплики: видно, кто и что сказал. Незаменимо для интервью, планёрок и переговоров.

Файлы TXT и SRT

Расшифровка скачивается текстом, а субтитры — в формате SRT, который понимают все видеоредакторы и видеохостинги.

Подсветка по словам

Текст синхронизирован со звуком: при воспроизведении подсвечивается произносимое слово — удобно сверять спорные места.

Русский и ещё 90+ языков

Модели обучены на многоязычных данных, поэтому одинаково уверенно расшифровывают русскую речь, английскую и смешанные записи.

Загрузка в один клик

Перетащите файл в окно чата — распознавание начнётся сразу. Ничего устанавливать и настраивать не нужно.

Три модели распознавания речи

Выберите модель под свою запись

Цена одинаковая у всех трёх — 40 токенов за секунду звучания. Различаются они тем, что умеют возвращать помимо текста.

GPT Transcribe

Рекомендуем

Для монологов: лекция, голосовое, диктофонная запись, аудиокнига

  • Самое точное распознавание русской речи
  • Знаки препинания и абзацы
  • Скачивание расшифровки в TXT
  • Без таймкодов и разделения по ролям

2 400 токенов за минуту записи

Расшифровать →

Whisper 1

Для субтитров: видео, ролики, курсы, монтаж

  • Таймкоды по фразам и отдельным словам
  • Готовый файл субтитров SRT
  • Подсветка слова при прослушивании
  • Без разделения по спикерам

2 400 токенов за минуту записи

Сделать субтитры →

GPT-4o Diarize

Для диалогов: интервью, планёрка, переговоры, созвон

  • Реплики подписаны по спикерам
  • Таймкоды у каждой реплики
  • Экспорт в TXT и SRT с именами ролей
  • Держит запись с несколькими голосами

2 400 токенов за минуту записи

Разделить по ролям →

Нужна обратная задача? В том же разделе работает озвучка текста — модель GPT-4o mini TTS читает готовый текст голосом на выбор и отдаёт mp3. Тарифицируется по символам, а не по секундам.

Прозрачная тарификация

Сколько будет стоить ваша запись

Списываются только секунды звучания — за паузы, тишину и повторное открытие расшифровки платить не нужно. Подвиньте ползунок и посмотрите цену.

Длительность записи 45 минут
1 мин 2 часа 4 часа
Тариф
40 токенов / сек
Спишется токенов
108 000
Это примерно
108 ₽
Хватит подарочных?
нужно пополнение

При регистрации начисляем 20 000 токенов — это около 8 минут расшифровки бесплатно, плюс по 5 000 токенов можно забирать каждый день.

Загрузить запись
Как это работает

От файла до готового текста

~ 15 секунд

Зарегистрируйтесь

Почта или телефон. Сразу начисляем 20 000 токенов и открываем все модели расшифровки.

~ 10 секунд

Загрузите запись

Перетащите файл в окно чата: mp3, wav, m4a, webm, mp4, mpeg, mpga — до 25 МБ за раз.

минуты, не часы

Заберите расшифровку

Текст появится в чате. Скопируйте его целиком или скачайте файлом — TXT или SRT.

Кому это экономит время

Задачи, которые закрывает расшифровка аудио

Час записи вручную набирается за три-четыре часа работы. Нейросеть проходит его за минуты — остаётся только вычитать.

Журналистам

Расшифровка интервью и комментариев: цитаты сразу с таймкодом, ничего не потеряется при сдаче материала.

Руководителям

Стенограмма планёрки и созвона: кто что пообещал, какие сроки назвали — всё в тексте, с ролями.

Студентам

Запись лекции превращается в конспект. Дальше текст можно сократить или разобрать в чате с нейросетью.

Подкастерам

Текстовая версия выпуска для сайта и субтитры SRT для видео — из одного и того же файла.

Юристам

Расшифровка переговоров и совещаний с привязкой ко времени и разделением реплик сторон.

HR и рекрутерам

Текст собеседования вместо заметок на бегу: можно сравнивать кандидатов по цитатам, а не по памяти.

Отделу продаж

Разбор звонков: что говорил клиент, где возражение, какие слова сработали. Материал для обучения команды.

Исследователям

Транскрибация глубинных интервью и фокус-групп — основа для кодирования и анализа данных.

Прозрачные цены

Пакеты токенов

Токен — внутренняя валюта EpicAI, общая для всех нейросетей сервиса. Не сгорает и не требует абонентской платы: тратится только на реальные задачи.

500 000 токенов ≈ 3,5 часа аудио
498 ₽
1 000 000 токенов ≈ 7 часов аудио
946 ₽
2 000 000 токенов ≈ 14 часов аудио
1 792 ₽
5 000 000 токенов ≈ 34 часа аудио
4 233 ₽
10 000 000 токенов ≈ 69 часов аудио
7 968 ₽
О сервисе

Перевод аудио в текст онлайн

Что такое расшифровка аудио в текст

Расшифровка аудио в текст (транскрибация) — это автоматический перевод устной речи в письменный вид. Вы загружаете аудиофайл, нейросеть распознаёт речь и возвращает готовый текст с пунктуацией. Раньше этим занимались вручную: час записи набирался три-четыре часа. Сейчас перевод аудио в текст занимает минуты.

На EpicAI работают модели распознавания речи от OpenAI — Whisper и GPT Transcribe. Они обучены на многоязычных данных, поэтому уверенно справляются с русской речью, диктофонными записями и созвонами с неидеальным звуком.

Какие записи можно расшифровать

  • Интервью, комментарии и глубинные опросы
  • Планёрки, совещания и переговоры
  • Онлайн-созвоны в Zoom, Telemost, Контур.Толк
  • Лекции, вебинары и записи курсов
  • Подкасты и выпуски для текстовой версии на сайте
  • Голосовые сообщения и диктофонные заметки
  • Видео — для последующих субтитров в SRT

Чем это удобнее ручного набора

Нейросеть не устаёт и не пропускает фразы: она обрабатывает запись целиком и сохраняет привязку ко времени. В расшифровке легко найти нужный фрагмент по таймкоду, а в диалогах — понять, кто именно произнёс реплику.

Готовый текст можно тут же передать другой нейросети EpicAI: сократить до выжимки, составить протокол встречи или список задач. Все модели живут в одном кабинете и оплачиваются общими токенами.

Требования к файлу

Форматыmp3, mp4, mpeg, mpga, m4a, wav, webm
Размер файладо 25 МБ за одну загрузку
Языкирусский, английский и ещё 90+
Результаттекст в чате, файлы TXT и SRT
Тариф40 токенов за секунду звучания
Вопросы и ответы

Частые вопросы о расшифровке аудио

Зарегистрируйтесь на EpicAI, откройте раздел «Аудио» и выберите модель расшифровки. Перетащите аудиофайл в окно чата — распознавание начнётся автоматически. Через несколько минут получите готовый текст, который можно скопировать или скачать в TXT и SRT.

При регистрации мы начисляем 20 000 токенов — этого хватает примерно на 8 минут расшифровки. Кроме того, каждый день можно забирать ещё по 5 000 токенов. То есть короткие записи, голосовые и фрагменты интервью расшифровываются бесплатно.

Тариф — 40 токенов за секунду звучания, то есть 144 000 токенов за час записи. В зависимости от пакета это примерно от 115 до 143 ₽ за час аудио. Точную сумму для своей записи можно посчитать калькулятором выше.

mp3, mp4, mpeg, mpga, m4a, wav и webm — то есть почти всё, что записывают диктофоны, мессенджеры и сервисы видеосвязи. Размер одного файла — до 25 МБ. Если запись длиннее, разделите её на части или сохраните в mp3 с меньшим битрейтом.

Да, для этого есть отдельная модель — GPT-4o Transcribe Diarize. Она разбивает запись на реплики и подписывает, кто говорит: «Спикер 1», «Спикер 2» и так далее. Это нужно для интервью, планёрок и переговоров, где важно понимать авторство фраз.

Выберите модель Whisper 1 — она возвращает таймкоды и формирует файл SRT. Его можно подключить в видеоредакторе или загрузить на видеохостинг как отдельную дорожку субтитров.

Нет. EpicAI работает напрямую из России без VPN, интерфейс и поддержка — на русском языке. Оплата проходит картами российских банков и через СБП.

На чистой записи расшифровка получается близкой к дословной — с пунктуацией и без пропусков. Точность падает на сильном фоновом шуме, при наложении голосов и на узкой терминологии: такие места стоит вычитать. Чем ближе микрофон к говорящему, тем лучше результат.

Расшифруйте первую запись прямо сейчас

Регистрация — 15 секунд. 20 000 токенов в подарок: этого хватит, чтобы перевести в текст голосовое, фрагмент интервью или короткую планёрку.

Без VPN · Оплата картой РФ и СБП · Поддержка на русском

Мы используем на сайте куки. В интернете без них никак.