Что получилось на образце
Запись — разговор менеджера и клиента, два голоса, 16 кГц моно. Распознавание — Whisper (small, int8) на обычном процессоре без видеокарты, на нашей машине; файл никуда не отправлялся. Роли расставлены по высоте голоса.
Слушайте и читайте
Щёлкните строку — запись перемотается к ней. Столбик справа от времени — высота голоса в этой реплике: так две роли разделяются без нейросети.
Четыре файла из одной записи
Сверка с тем, что было сказано
Мы знаем, что говорилось на записи, слово в слово. Ниже — текст распознавания, где расхождения с оригиналом подсвечены: заменено, пропущено. Это и есть то, что правит вычитка перед сдачей.
Как это устроено
Файл остаётся у нас
Распознаёт Whisper на нашем оборудовании — запись не уходит в чужие облачные сервисы. Для длинных записей — наша GPU-ферма: 10 минут записи за 22 секунды.
Роли — по голосу
Два участника делятся по высоте тона без нейросети (на образце 20 реплик из 20 верно). Три и больше голосов, перебивания — модуль разделения голосов на ферме, спорные места правятся при вычитке.
Вычитка, а не «как получилось»
Дословный текст сверяется на слух в местах, где модель не уверена (у каждого слова есть вероятность). Имена по просьбе заменяются на роли, числа и термины — по вашему глоссарию.
Цена и срок
Пришлите свою запись — вернём такой же разбор
Любой формат: mp3, m4a, wav, ogg, голосовые из мессенджеров, видео. Ссылка на облако или файл. Первые пять минут расшифруем бесплатно, чтобы вы посмотрели качество на своём звуке.
Написать намЧестно про образец
Записи заказчика у нас нет, а чужие разговоры публиковать нельзя, поэтому образец — разговор, озвученный двумя синтезированными голосами по нашему сценарию. Так оригинал известен дословно и расхождения посчитаны, а не оценены на глаз. Живая речь с шумом и перебиваниями распознаётся хуже — 3–8 % слов на модели small, меньше на большой модели фермы; поэтому в цену с вычиткой заложен человек. Цифры на странице сняты один раз 25.09.2026 и не обновляются сами.