Перейти к основному содержимому

Расшифровка

Настройки → Расшифровка задают, как звук становится текстом: на каком языке и каким распознавателем.

Разговор расшифровывается, когда вы просите об этом в окне записей, — или сам, если вы включили обработку в разделе «Обработка». Расшифровать по запросу можно в окне записей, а автоматически — если включено Обрабатывать разговоры автоматически в Обработке. Распознаватель на своей машине не стоит ничего; облачный берёт плату за минуту звука.

Язык​

Язык — двухбуквенный код языка по ISO 639-1 (ru, en, uk, kk, de…). Оставьте поле пустым — язык определит распознаватель; это правильно, если только ваши звонки не идут на языке, который он постоянно слышит неправильно. Если почти все разговоры на русском, укажите ru.

Распознаватели​

Распознаватель — сервис распознавания речи, которому телефон отправляет звук. Кнопка Добавить добавляет распознаватель, кнопка Проверить в форме проверяет, что сервис действительно отвечает. Каждый распознаватель показан с названием, а под ним — модель и адрес сервиса. На картинке их пять:

НазваниеМодельАдрес
Yandex SpeechKitgeneralhttps://stt.api.cloud.yandex.net
X.ai(пусто: модель сервиса по умолчанию)https://api.x.ai/v1
ElevenLabsscribe_v2https://api.elevenlabs.io/v1
Deepgramnova-2https://api.deepgram.com/v1
OpenAIgpt-4o-transcribehttps://api.openai.com/v1/

Распознаватель с пометкой основной справа в строке (на картинке — Yandex SpeechKit) используется, когда вы не выбрали другой. Можно держать несколько. Выпадающий список над расшифровкой в окне записей перечисляет расшифровки, сделанные каждым распознавателем.

Модель можно оставить пустой — тогда сервис использует свою модель по умолчанию.

Виды распознавателей​

Поле Вид в форме распознавателя выбирает, с каким сервисом он говорит:

ВидДля чего
Совместимый с OpenAI (Whisper, OpenAI)OpenAI и любой сервер с интерфейсом OpenAI — в том числе собственные модели. Вид по умолчанию.
DeepgramОблачный сервис Deepgram.
ElevenLabs (Scribe)Облачный сервис ElevenLabs.
SpeechmaticsОблачный сервис Speechmatics.
xAI (Grok)Облачный сервис X.ai.
Yandex SpeechKitРаспознавание речи Яндекс Облака. Есть в списке, только когда страна — Россия или соседняя страна; см. ниже.

Форма распознавателя​

ПолеЧто это
НазваниеКак распознаватель показан в списке и над расшифровками.
ВидСервис; см. таблицу выше. При выборе вида подставляются его адрес и модель по умолчанию.
АдресАдрес сервиса (Например: http://127.0.0.1:8000/v1).
ПроверитьСпрашивает сервис и пишет ответ: Ответил и предлагает N моделей, Ответил. Список моделей не выдаёт — впишите название, Ответил. Модели у этого распознавателя нет — выбирать нечего, Никто не ответил или Отказ: … с причиной.
МодельМодель сервиса. После Проверить список заполняется моделями, которые сервис назвал.
КлючAPI-ключ сервиса. Хранится в хранилище ключей этого компьютера, а не в файле настроек.
Использовать по умолчаниюДелает распознаватель основным.
ВключёнВыключенный распознаватель остаётся в списке, но не используется.
Дополнительные настройкиРедкие настройки; у каждого вида свои. Для Yandex SpeechKit они описаны ниже.

Yandex SpeechKit​

Yandex SpeechKit — распознавание речи Яндекс Облака. Он хорошо понимает русскую речь, в том числе телефонную, звук и текст обрабатываются в Яндекс Облаке, а платить можно в рублях. Для компании в России это обычно самый простой распознаватель: не нужен ни зарубежный счёт, ни собственный сервер с видеокартой.

SpeechKit появляется в списке Вид, когда в Настройки → О программе → Страна выбрана Россия (а также Беларусь, Казахстан, Узбекистан, Кыргызстан, Таджикистан, Туркменистан, Армения или Азербайджан). При другой стране этого вида в списке нет; уже добавленный распознаватель продолжает работать.

Что нужно в Яндекс Облаке​

  1. Платёжный аккаунт и каталог в консоли Яндекс Облака.
  2. Сервисный аккаунт в этом каталоге с ролью ai.speechkit-stt.user. Если тот же аккаунт будет работать и с YandexGPT, добавьте ему роль ai.languageModels.user — тогда хватит одного ключа на обоих.
  3. API-ключ этого сервисного аккаунта. Он показывается один раз — сразу вставьте его в поле Ключ.

Подробности — в документации Яндекс Облака: аутентификация в SpeechKit и асинхронное распознавание.

Добавление SpeechKit​

  1. Убедитесь, что в О программе выбрана страна Россия.
  2. Настройки → Расшифровка → Добавить.
  3. В поле Вид выберите Yandex SpeechKit. Адрес https://stt.api.cloud.yandex.net и модель general подставятся сами.
  4. Вставьте API-ключ в поле Ключ.
  5. Нажмите Проверить, затем Сохранить. Отметьте Использовать по умолчанию, если SpeechKit должен расшифровывать все разговоры.

Сделайте пробную запись и откройте её в окне записей: над расшифровкой появится ★ Yandex SpeechKit.

Как SpeechKit расшифровывает​

Телефон пользуется асинхронным распознаванием SpeechKit (API v3): отправляет запись целиком, получает номер операции и спрашивает Адрес операций, пока распознавание не закончится. Поэтому длинный разговор расшифровывается минуты, а не секунды, — полоска над списком записей показывает, что сейчас в работе. Звонок записан в два канала, так что в расшифровке видно, где говорили вы, а где собеседник.

Модели SpeechKit​

МодельЧто это
generalОсновная модель распознавания. Подходит для звонков и встреч. Подставляется по умолчанию.
general:rcСледующая версия модели до её выпуска (release candidate): иногда точнее, но может меняться.
general:deprecatedПредыдущая версия модели — на случай, если новая распознаёт ваши разговоры хуже.
deferred-generalОтложенное распознавание: результат приходит позже, зато дешевле. Подходит, если расшифровка не нужна срочно.

Актуальный список моделей и языков — в документации SpeechKit.

Дополнительные настройки SpeechKit​

Дополнительные настройки внизу формы раскрывают редкие поля. Обычно их не трогают.

ПолеПо умолчаниюЧто это
РегионпустоРегион облака, если ваша установка Яндекс Облака его требует.
КаталогпустоНужен только для IAM-токена личного аккаунта: такой аккаунт не принадлежит каталогу. API-ключ сервисного аккаунта уже знает свой каталог, так что поле можно оставить пустым.
Писать числа цифрамивкл.Суммы, даты и номера телефонов приходят записанными цифрами, а не прописанными словами, как их произнесли. Выключите, чтобы каждое слово осталось таким, каким его сказали.
Предел отправки45000000Самый большой файл, который телефон отправит, в байтах (около 45 МБ). Запись больше этого отклоняется до отправки, а не после неё.
Предел длины14400Самая длинная запись, которую телефон отправит, в секундах (4 часа). Ноль — нашего предела нет, действует предел провайдера.
Запросов сразу2Сколько распознаваний телефон держит выполняющимися одновременно.
Адрес операцийhttps://operation.api.cloud.yandex.netАдрес, где спрашивают о переданном распознавании, пока оно не закончится. Адрес самого Яндекса, если у вашей установки нет другого.
ДополнительнопустоПараметры вида имя = значение, по одному в строке, — передаются распознавателю как есть. Оставьте пустым, если сервис ничего такого не требует.
ОжиданиепустоСколько минут ждать результата. Пусто — ожидание считается по длительности каждой записи, и почти всем стоит оставить так.
подсказка

Если поле Ключ заполнено API-ключом сервисного аккаунта, Каталог и Регион можно не заполнять — SpeechKit сам знает, к какому каталогу относится ключ.

Какую модель выбрать​

В таблице — модели распознавания речи сервисов, которые можно подключить. Жирным выделены модели, настроенные на картинке. У распознавателя X.ai модель пустая, поэтому используется модель сервиса по умолчанию — grok-voice-transcribe-2.0.

Сервис и адресМодельДля чего
Yandex SpeechKit
https://stt.api.cloud.yandex.net
generalОсновная модель; хорошо знает русскую речь. Доступна при стране Россия.
general:rcСледующая версия модели до выпуска.
deferred-generalОтложенное, более дешёвое распознавание.
OpenAI
https://api.openai.com/v1
gpt-transcribeМодель, которую OpenAI рекомендует для записанной речи на языке оригинала.
gpt-4o-transcribeРасшифровка общего назначения.
gpt-4o-mini-transcribeОблегчённый и более дешёвый вариант предыдущей.
gpt-4o-transcribe-diarizeРазмечает, кто когда говорит. Берите, только если это нужно.
whisper-1Старая модель Whisper — для особых задач вроде меток времени по словам и субтитров.
ElevenLabs
https://api.elevenlabs.io/v1
scribe_v2Расшифровка общего назначения на 90+ языках, с разделением говорящих.
scribe_v2_medicalТо же, настроено на медицинскую речь.
scribe_v1Первое поколение; устарело, используйте scribe_v2.
Deepgram
https://api.deepgram.com/v1
nova-3Лучшая модель Deepgram общего назначения — для встреч, шумной и многоязычной речи.
nova-2Предыдущее поколение; оставьте её для языков, которых nova-3 ещё не знает.
enhancedСтарый уровень с меньшим числом ошибок, чем base.
baseСамый старый уровень, для больших объёмов.
whisperWhisper, запущенный у Deepgram.
X.ai
https://api.x.ai/v1
grok-voice-transcribe-2.0Модель по умолчанию; 25 языков.
grok-voice-transcribe-1.0Устарела: сервис переадресует её на 2.0.

Что стоит знать до выбора:

  • Где обрабатываются данные. Yandex SpeechKit работает в Яндекс Облаке; OpenAI, ElevenLabs, Deepgram и X.ai — за рубежом. Если звук не должен покидать страну или вашу сеть, берите SpeechKit или собственную модель.
  • Размер файла. OpenAI принимает файлы до 25 МБ, X.ai — до 500 МБ; для SpeechKit предел задаётся в его дополнительных настройках. Длинный разговор может оказаться больше, чем принимает облачный сервис.
  • Цена. Облачные сервисы берут плату за минуту звука, тарифы зависят от модели и меняются; смотрите их на странице сервиса, прежде чем переключаться.
  • Языки. У каждого сервиса свой список; проверьте свой и укажите код Языка, если распознаватель угадывает неверно.
  • Модели реального времени, например scribe_v2_realtime или flux у Deepgram, сделаны для живых потоков и в таблицу не входят: телефон расшифровывает готовые записи.

Список моделей сервисов меняется часто. Если нужной модели здесь нет, актуальный список — в документации сервиса: Yandex SpeechKit, OpenAI, ElevenLabs, Deepgram, X.ai; Модель — это название ровно так, как его даёт сервис.

Собственные модели​

Распознаватель не обязан быть облачным сервисом. Телефон может использовать любую модель, доступную через API, совместимый с OpenAI, — интерфейс POST /v1/audio/transcriptions, — будь то на вашем компьютере или на собственном сервере. Звук не покидает ваших помещений, поминутной оплаты нет, ограничений на объём тоже.

Чтобы добавить такую модель, нажмите Добавить, оставьте вид Совместимый с OpenAI (Whisper, OpenAI) и укажите:

  • адрес сервера, вплоть до /v1 включительно, например http://localhost:8000/v1 для самого компьютера или http://asr.local:8080/v1 для сервера в вашей сети;
  • название модели ровно так, как его перечисляет сервер, например openai/whisper-large-v3-turbo.

Что можно использовать​

Обычный выбор — Whisper, открытая модель распознавания речи от OpenAI. Она бесплатна, понимает около сотни языков, включая русский, и бывает нескольких размеров: маленькая модель работает на обычном компьютере, большие заметно точнее, и им лучше дать видеокарту.

МодельПримечания
whisper-large-v3Самый точный Whisper. Для сервера с GPU.
openai/whisper-large-v3-turboБолее быстрая версия large-v3 с небольшой потерей точности.
Systran/faster-whisper-large-v3large-v3, переведённая на движок faster-whisper: быстрее и экономнее к памяти.
medium, small, baseМеньшие модели Whisper, для компьютера без видеокарты.

Вокруг Whisper и построены эти серверы. Некоторые из них умеют обслуживать и другие модели распознавания речи, например NVIDIA Parakeet.

Серверы с API, совместимым с OpenAI​

Модель должен запускать сервер, у которого есть совместимая с OpenAI точка /v1/audio/transcriptions. Она есть у этих:

СерверЧто это
vLLMВысокопроизводительный сервер моделей. После запуска обслуживает Whisper по адресу http://localhost:8000/v1.
SpeachesСервер речевых моделей, «Ollama для речи», на основе faster-whisper. Загружает модель при первом обращении.
whisper.cppЭффективно запускает Whisper на процессоре, в том числе на Apple silicon. Его whisper-server запускается с --inference-path /v1/audio/transcriptions.
LocalAIЗамена OpenAI, которая запускает модели локально.

Любой другой сервер с той же точкой работает так же. Если серверу нужен ключ, введите его, как для облачного сервиса.

Прежде чем полагаться на сервер, сделайте пробную запись и посмотрите расшифровку в окне записей: разговор на языке, который модель знает плохо, видно сразу.