Сделано до отклика · 25.09.2026

Аудио в текст. Вот запись — вот расшифровка

Заказчик просит «прослушать аудио и переписать в текст». Мы не пишем «сделаю» — ниже запись разговора на полторы минуты и её расшифровка, снятая нашим распознаванием: дословно с таймкодами, чистый текст, по ролям и субтитры. Нажмите «слушать» — текст бежит вместе с записью.

Что получилось на образце

Запись — разговор менеджера и клиента, два голоса, 16 кГц моно. Распознавание — Whisper (small, int8) на обычном процессоре без видеокарты, на нашей машине; файл никуда не отправлялся. Роли расставлены по высоте голоса.

Слушайте и читайте

00:0001:26
Менеджер · ниже 147 ГцКлиент · выше 147 Гц

    Щёлкните строку — запись перемотается к ней. Столбик справа от времени — высота голоса в этой реплике: так две роли разделяются без нейросети.

    Четыре файла из одной записи

    
            

    Сверка с тем, что было сказано

    Мы знаем, что говорилось на записи, слово в слово. Ниже — текст распознавания, где расхождения с оригиналом подсвечены: заменено, пропущено. Это и есть то, что правит вычитка перед сдачей.

    Как это устроено

    Файл остаётся у нас

    Распознаёт Whisper на нашем оборудовании — запись не уходит в чужие облачные сервисы. Для длинных записей — наша GPU-ферма: 10 минут записи за 22 секунды.

    Роли — по голосу

    Два участника делятся по высоте тона без нейросети (на образце 20 реплик из 20 верно). Три и больше голосов, перебивания — модуль разделения голосов на ферме, спорные места правятся при вычитке.

    Вычитка, а не «как получилось»

    Дословный текст сверяется на слух в местах, где модель не уверена (у каждого слова есть вероятность). Имена по просьбе заменяются на роли, числа и термины — по вашему глоссарию.

    Цена и срок

    20 ₽ за минуту
    Дословно с таймкодами и ролями + чистый текст + SRT, с вычиткой на слух. 5 000 ₽ — это до 4 часов записи.
    5 ₽ за минуту
    Черновая расшифровка без вычитки: те же четыре файла, ошибки как на образце (3–8 % слов) — для поиска по записям и заметок.
    Сутки на каждые 2 часа записи
    Первый файл — в день получения, чтобы согласовать формат. Плохой звук (диктофон в кармане, зал) — скажем сразу, до денег.

    Пришлите свою запись — вернём такой же разбор

    Любой формат: mp3, m4a, wav, ogg, голосовые из мессенджеров, видео. Ссылка на облако или файл. Первые пять минут расшифруем бесплатно, чтобы вы посмотрели качество на своём звуке.

    Написать нам

    Честно про образец

    Записи заказчика у нас нет, а чужие разговоры публиковать нельзя, поэтому образец — разговор, озвученный двумя синтезированными голосами по нашему сценарию. Так оригинал известен дословно и расхождения посчитаны, а не оценены на глаз. Живая речь с шумом и перебиваниями распознаётся хуже — 3–8 % слов на модели small, меньше на большой модели фермы; поэтому в цену с вычиткой заложен человек. Цифры на странице сняты один раз 25.09.2026 и не обновляются сами.