Расшифровка
Настройки → Расшифровка задают, как звук становится текстом: на каком языке и каким распознавателем.
Разговор расшифровывается, когда вы просите об этом в окне записей, — или сам, если вы включили обработку в разделе «Обработка». Расшифровать по запросу можно в окне записей, а автоматически — если включено Обрабатывать разговоры автоматически в Обработке. Распознаватель на своей машине не стоит ничего; облачный берёт плату за минуту звука.
Язык
Язык — двухбуквенный код языка по ISO 639-1 (ru, en, uk, kk, de…). Оставьте поле пустым — язык определит распознаватель; это правильно, если только ваши звонки не идут на языке, который он постоянно слышит неправильно. Если почти все разговоры на русском, укажите ru.
Распознаватели
Распознаватель — сервис распознавания речи, которому телефон отправляет звук. Кнопка Добавить добавляет распознаватель, кнопка Проверить в форме проверяет, что сервис действительно отвечает. Каждый распознаватель показан с названием, а под ним — модель и адрес сервиса. На картинке их пять:
| Название | Модель | Адрес |
|---|---|---|
| Yandex SpeechKit | general | https://stt.api.cloud.yandex.net |
| X.ai | (пусто: модель сервиса по умолчанию) | https://api.x.ai/v1 |
| ElevenLabs | scribe_v2 | https://api.elevenlabs.io/v1 |
| Deepgram | nova-2 | https://api.deepgram.com/v1 |
| OpenAI | gpt-4o-transcribe | https://api.openai.com/v1/ |
Распознаватель с пометкой основной справа в строке (на картинке — Yandex SpeechKit) используется, когда вы не выбрали другой. Можно держать несколько. Выпадающий список над расшифровкой в окне записей перечисляет расшифровки, сделанные каждым распознавателем.
Модель можно оставить пустой — тогда сервис использует свою модель по умолчанию.
Виды распознавателей
Поле Вид в форме распознавателя выбирает, с каким сервисом он говорит:
| Вид | Для чего |
|---|---|
| Совместимый с OpenAI (Whisper, OpenAI) | OpenAI и любой сервер с интерфейсом OpenAI — в том числе собственные модели. Вид по умолчанию. |
| Deepgram | Облачный сервис Deepgram. |
| ElevenLabs (Scribe) | Облачный сервис ElevenLabs. |
| Speechmatics | Облачный сервис Speechmatics. |
| xAI (Grok) | Облачный сервис X.ai. |
| Yandex SpeechKit | Распознавание речи Яндекс Облака. Есть в списке, только когда страна — Россия или соседняя страна; см. ниже. |
Форма распознавателя
| Поле | Что это |
|---|---|
| Название | Как распознаватель показан в списке и над расшифровками. |
| Вид | Сервис; см. таблицу выше. При выборе вида подставляются его адрес и модель по умолчанию. |
| Адрес | Адрес сервиса (Например: http://127.0.0.1:8000/v1). |
| Проверить | Спрашивает сервис и пишет ответ: Ответил и предлагает N моделей, Ответил. Список моделей не выдаёт — впишите название, Ответил. Модели у этого распознавателя нет — выбирать нечего, Никто не ответил или Отказ: … с причиной. |
| Модель | Модель сервиса. После Проверить список заполняется моделями, которые сервис назвал. |
| Ключ | API-ключ сервиса. Хранится в хранилище ключей этого компьютера, а не в файле настроек. |
| Использовать по умолчанию | Делает распознаватель основным. |
| Включён | Выключенный распознаватель остаётся в списке, но не используется. |
| Дополнительные настройки | Редкие настройки; у каждого вида свои. Для Yandex SpeechKit они описаны ниже. |
Yandex SpeechKit
Yandex SpeechKit — распознавание речи Яндекс Облака. Он хорошо понимает русскую речь, в том числе телефонную, звук и текст обрабатываются в Яндекс Облаке, а платить можно в рублях. Для компании в России это обычно самый простой распознаватель: не нужен ни зарубежный счёт, ни собственный сервер с видеокартой.
SpeechKit появляется в списке Вид, когда в Настройки → О программе → Страна выбрана Россия (а также Беларусь, Казахстан, Узбекистан, Кыргызстан, Таджикистан, Туркменистан, Армения или Азербайджан). При другой стране этого вида в списке нет; уже добавленный распознаватель продолжает работать.
Что нужно в Яндекс Облаке
- Платёжный аккаунт и каталог в консоли Яндекс Облака.
- Сервисный аккаунт в этом каталоге с ролью
ai.speechkit-stt.user. Если тот же аккаунт будет работать и с YandexGPT, добавьте ему рольai.languageModels.user— тогда хватит одного ключа на обоих. - API-ключ этого сервисного аккаунта. Он показывается один раз — сразу вставьте его в поле Ключ.
Подробности — в документации Яндекс Облака: аутентификация в SpeechKit и асинхронное распознавание.
Добавление SpeechKit
- Убедитесь, что в О программе выбрана страна Россия.
- Настройки → Расшифровка → Добавить.
- В поле Вид выберите Yandex SpeechKit. Адрес
https://stt.api.cloud.yandex.netи модельgeneralподставятся сами. - Вставьте API-ключ в поле Ключ.
- Нажмите Проверить, затем Сохранить. Отметьте Использовать по умолчанию, если SpeechKit должен расшифровывать все разговоры.
Сделайте пробную запись и откройте её в окне записей: над расшифровкой появится ★ Yandex SpeechKit.
Как SpeechKit расшифровывает
Телефон пользуется асинхронным распознаванием SpeechKit (API v3): отправляет запись целиком, получает номер операции и спрашивает Адрес операций, пока распознавание не закончится. Поэтому длинный разговор расшифровывается минуты, а не секунды, — полоска над списком записей показывает, что сейчас в работе. Звонок записан в два канала, так что в расшифровке видно, где говорили вы, а где собеседник.
Модели SpeechKit
| Модель | Что это |
|---|---|
general | Основная модель распознавания. Подходит для звонков и встреч. Подставляется по умолчанию. |
general:rc | Следующая версия модели до её выпуска (release candidate): иногда точнее, но может меняться. |
general:deprecated | Предыдущая версия модели — на случай, если новая распознаёт ваши разговоры хуже. |
deferred-general | Отложенное распознавание: результат приходит позже, зато дешевле. Подходит, если расшифровка не нужна срочно. |
Актуальный список моделей и языков — в документации SpeechKit.
Дополнительные настройки SpeechKit
Дополнительные настройки внизу формы раскрывают редкие поля. Обычно их не трогают.
| Поле | По умолчанию | Что это |
|---|---|---|
| Регион | пусто | Регион облака, если ваша установка Яндекс Облака его требует. |
| Каталог | пусто | Нужен только для IAM-токена личного аккаунта: такой аккаунт не принадлежит каталогу. API-ключ сервисного аккаунта уже знает свой каталог, так что поле можно оставить пустым. |
| Писать числа цифрами | вкл. | Суммы, даты и номера телефонов приходят записанными цифрами, а не прописанными словами, как их произнесли. Выключите, чтобы каждое слово осталось таким, каким его сказали. |
| Предел отправки | 45000000 | Самый большой файл, который телефон отправит, в байтах (около 45 МБ). Запись больше этого отклоняется до отправки, а не после неё. |
| Предел длины | 14400 | Самая длинная запись, которую телефон отправит, в секундах (4 часа). Ноль — нашего предела нет, действует предел провайдера. |
| Запросов сразу | 2 | Сколько распознаваний телефон держит выполняющимися одновременно. |
| Адрес операций | https://operation.api.cloud.yandex.net | Адрес, где спрашивают о переданном распознавании, пока оно не закончится. Адрес самого Яндекса, если у вашей установки нет другого. |
| Дополнительно | пусто | Параметры вида имя = значение, по одному в строке, — передаются распознавателю как есть. Оставьте пустым, если сервис ничего такого не требует. |
| Ожидание | пусто | Сколько минут ждать результата. Пусто — ожидание считается по длительности каждой записи, и почти всем стоит оставить так. |
Если поле Ключ заполнено API-ключом сервисного аккаунта, Каталог и Регион можно не заполнять — SpeechKit сам знает, к какому каталогу относится ключ.
Какую модель выбрать
В таблице — модели распознавания речи сервисов, которые можно подключить. Жирным выделены модели, настроенные на картинке. У распознавателя X.ai модель пустая, поэтому используется модель сервиса по умолчанию — grok-voice-transcribe-2.0.
| Сервис и адрес | Модель | Для чего |
|---|---|---|
Yandex SpeechKithttps://stt.api.cloud.yandex.net | general | Основная модель; хорошо знает русскую речь. Доступна при стране Россия. |
general:rc | Следующая версия модели до выпуска. | |
deferred-general | Отложенное, более дешёвое распознавание. | |
OpenAIhttps://api.openai.com/v1 | gpt-transcribe | Модель, которую OpenAI рекомендует для записанной речи на языке оригинала. |
gpt-4o-transcribe | Расшифровка общего назначения. | |
gpt-4o-mini-transcribe | Облегчённый и более дешёвый вариант предыдущей. | |
gpt-4o-transcribe-diarize | Размечает, кто когда говорит. Берите, только если это нужно. | |
whisper-1 | Старая модель Whisper — для особых задач вроде меток времени по словам и субтитров. | |
ElevenLabshttps://api.elevenlabs.io/v1 | scribe_v2 | Расшифровка общего назначения на 90+ языках, с разделением говорящих. |
scribe_v2_medical | То же, настроено на медицинскую речь. | |
scribe_v1 | Первое поколение; устарело, используйте scribe_v2. | |
Deepgramhttps://api.deepgram.com/v1 | nova-3 | Лучшая модель Deepgram общего назначения — для встреч, шумной и многоязычной речи. |
nova-2 | Предыдущее поколение; оставьте её для языков, которых nova-3 ещё не знает. | |
enhanced | Старый уровень с меньшим числом ошибок, чем base. | |
base | Самый старый уровень, для больших объёмов. | |
whisper | Whisper, запущенный у Deepgram. | |
X.aihttps://api.x.ai/v1 | grok-voice-transcribe-2.0 | Модель по умолчанию; 25 языков. |
grok-voice-transcribe-1.0 | Устарела: сервис переадресует её на 2.0. |
Что стоит знать до выбора:
- Где обрабатываются данные. Yandex SpeechKit работает в Яндекс Облаке; OpenAI, ElevenLabs, Deepgram и X.ai — за рубежом. Если звук не должен покидать страну или вашу сеть, берите SpeechKit или собственную модель.
- Размер файла. OpenAI принимает файлы до 25 МБ, X.ai — до 500 МБ; для SpeechKit предел задаётся в его дополнительных настройках. Длинный разговор может оказаться больше, чем принимает облачный сервис.
- Цена. Облачные сервисы берут плату за минуту звука, тарифы зависят от модели и меняются; смотрите их на странице сервиса, прежде чем переключаться.
- Языки. У каждого сервиса свой список; проверьте свой и укажите код Языка, если распознаватель угадывает неверно.
- Модели реального времени, например
scribe_v2_realtimeилиfluxу Deepgram, сделаны для живых потоков и в таблицу не входят: телефон расшифровывает готовые записи.
Список моделей сервисов меняется часто. Если нужной модели здесь нет, актуальный список — в документации сервиса: Yandex SpeechKit, OpenAI, ElevenLabs, Deepgram, X.ai; Модель — это название ровно так, как его даёт сервис.
Собственные модели
Распознаватель не обязан быть облачным сервисом. Телефон может использовать любую модель, доступную через API, совместимый с OpenAI, — интерфейс POST /v1/audio/transcriptions, — будь то на вашем компьютере или на собственном сервере. Звук не покидает ваших помещений, поминутной оплаты нет, ограничений на объём тоже.
Чтобы добавить такую модель, нажмите Добавить, оставьте вид Совместимый с OpenAI (Whisper, OpenAI) и укажите:
- адрес сервера, вплоть до
/v1включительно, напримерhttp://localhost:8000/v1для самого компьютера илиhttp://asr.local:8080/v1для сервера в вашей сети; - название модели ровно так, как его перечисляет сервер, например
openai/whisper-large-v3-turbo.
Что можно использовать
Обычный выбор — Whisper, открытая модель распознавания речи от OpenAI. Она бесплатна, понимает около сотни языков, включая русский, и бывает нескольких размеров: маленькая модель работает на обычном компьютере, большие заметно точнее, и им лучше дать видеокарту.
| Модель | Примечания |
|---|---|
whisper-large-v3 | Самый точный Whisper. Для сервера с GPU. |
openai/whisper-large-v3-turbo | Более быстрая версия large-v3 с небольшой потерей точности. |
Systran/faster-whisper-large-v3 | large-v3, переведённая на движок faster-whisper: быстрее и экономнее к памяти. |
medium, small, base | Меньшие модели Whisper, для компьютера без видеокарты. |
Вокруг Whisper и построены эти серверы. Некоторые из них умеют обслуживать и другие модели распознавания речи, например NVIDIA Parakeet.
Серверы с API, совместимым с OpenAI
Модель должен запускать сервер, у которого есть совместимая с OpenAI точка /v1/audio/transcriptions. Она есть у этих:
| Сервер | Что это |
|---|---|
| vLLM | Высокопроизводительный сервер моделей. После запуска обслуживает Whisper по адресу http://localhost:8000/v1. |
| Speaches | Сервер речевых моделей, «Ollama для речи», на основе faster-whisper. Загружает модель при первом обращении. |
| whisper.cpp | Эффективно запускает Whisper на процессоре, в том числе на Apple silicon. Его whisper-server запускается с --inference-path /v1/audio/transcriptions. |
| LocalAI | Замена OpenAI, которая запускает модели локально. |
Любой другой сервер с той же точкой работает так же. Если серверу нужен ключ, введите его, как для облачного сервиса.
Прежде чем полагаться на сервер, сделайте пробную запись и посмотрите расшифровку в окне записей: разговор на языке, который модель знает плохо, видно сразу.