Přeskočit na hlavní obsah

Přepis

Nastavení → Přepis určuje, jak se ze zvuku stane text: v jakém jazyce a kterým rozpoznávačem.

Rozhovor se přepíše, když o to požádáte v okně nahrávek, nebo sám, pokud je ve Zpracování zapnuto Zpracovávat hovory automaticky. Rozpoznávač na vlastním počítači nestojí nic; ten v cloudu účtuje za minutu zvuku.

Jazyk​

Jazyk je dvoupísmenný kód jazyka podle ISO 639-1 (en, de, es, fr, sr…). Nechte ho prázdný a rozhodne rozpoznávač — to je správně, pokud vaše hovory nejsou v jazyce, který rozpoznávač opakovaně slyší špatně.

Rozpoznávače​

Rozpoznávač je služba převodu řeči na text, které telefon posílá zvuk. Nový přidáte tlačítkem Přidat; tlačítko Vyzkoušet ve formuláři ověří, že služba skutečně odpovídá. Každý je uveden názvem a pod ním modelem a adresou své služby. Na obrázku jsou čtyři:

NázevModelAdresa
X.ai(prázdné: výchozí model služby)https://api.x.ai/v1
ElevenLabsscribe_v2https://api.elevenlabs.io/v1
Deepgramnova-2https://api.deepgram.com/v1
OpenAIgpt-4o-transcribehttps://api.openai.com/v1/

Ten, který má vpravo v řádku označení výchozí (na obrázku X.ai), se použije, když nevyberete jiný. Můžete jich mít několik. Rozbalovací seznam nad přepisem v okně nahrávek uvádí přepisy od jednotlivých rozpoznávačů.

Model může zůstat prázdný. Služba pak použije svůj výchozí.

Jaký model vybrat​

Tabulka uvádí modely převodu řeči na text čtyř služeb z obrázku. Modely tučně jsou ty, které jsou na obrázku nastaveny. U rozpoznávače X.ai je model prázdný, takže se použije výchozí model služby, grok-voice-transcribe-2.0.

Služba a adresaModelK čemu je
OpenAI
https://api.openai.com/v1
gpt-transcribeModel, který OpenAI doporučuje pro nahranou řeč v původním jazyce.
gpt-4o-transcribeUniverzální přepis.
gpt-4o-mini-transcribeLehčí a levnější varianta předchozího.
gpt-4o-transcribe-diarizeOznačuje, kdo kdy mluví. Používejte, jen pokud to potřebujete.
whisper-1Starší model Whisper, ponechaný pro zvláštní účely, jako jsou časové značky slov a titulky.
ElevenLabs
https://api.elevenlabs.io/v1
scribe_v2Univerzální přepis ve více než 90 jazycích s rozlišením mluvčích.
scribe_v2_medicalTotéž, vyladěné pro klinický zvuk.
scribe_v1První generace; zastaralá, použijte scribe_v2.
Deepgram
https://api.deepgram.com/v1
nova-3Nejlepší univerzální model Deepgramu pro schůzky, hlučný a vícejazyčný zvuk.
nova-2Předchozí generace; ponechte ji pro jazyky, které nova-3 zatím nepodporuje.
enhancedStarší úroveň s nižší chybovostí než base.
baseNejstarší úroveň, pro velké objemy.
whisperWhisper provozovaný Deepgramem.
X.ai
https://api.x.ai/v1
grok-voice-transcribe-2.0Výchozí; 25 jazyků.
grok-voice-transcribe-1.0Zastaralý: služba ho přesměruje na 2.0.

Co je dobré vědět před výběrem:

  • Velikost souboru. OpenAI přijímá soubory do 25 MB, X.ai do 500 MB. Dlouhý rozhovor může být větší, než cloudová služba přijme.
  • Cena. Cloudové služby účtují za minutu zvuku a sazby se liší podle modelu a mění se; před změnou si je přečtěte na stránce služby.
  • Jazyky. Každá služba má vlastní seznam; ověřte si ten svůj a nastavte kód Jazyka, pokud rozpoznávač hádá špatně.
  • Modely v reálném čase, jako scribe_v2_realtime nebo flux od Deepgramu, jsou určeny pro živé přenosy a v tabulce nejsou: telefon přepisuje hotové nahrávky.

Seznam modelů služby se často mění. Pokud zde model, který chcete, chybí, aktuální seznam je v dokumentaci služby — OpenAI, ElevenLabs, Deepgram, X.ai — Model je název přesně tak, jak ho služba uvádí.

Vlastní modely​

Rozpoznávač nemusí být cloudová služba. Telefon může použít jakýkoli model zpřístupněný přes API kompatibilní s OpenAI — rozhraní POST /v1/audio/transcriptions — ať běží lokálně na vašem počítači, nebo na vlastním serveru. Zvuk nikdy neopustí vaše prostory, nic se neúčtuje za minutu a objem není omezen.

Při přidání stiskněte Přidat a zadejte:

  • adresu serveru včetně /v1, například http://localhost:8000/v1 pro tento počítač nebo http://asr.local:8080/v1 pro server ve vaší síti;
  • název modelu přesně tak, jak ho server uvádí, například openai/whisper-large-v3-turbo.

Co lze použít​

Obvyklou volbou je Whisper, otevřený model rozpoznávání řeči od OpenAI. Používá se zdarma, rozumí asi stovce jazyků a má několik velikostí: malý model běží na běžném počítači, velké jsou znatelně přesnější a nejlépe jim je dát grafickou kartu.

ModelPoznámky
whisper-large-v3Nejpřesnější Whisper. Pro server s GPU.
openai/whisper-large-v3-turboRychlejší verze large-v3 s malou ztrátou přesnosti.
Systran/faster-whisper-large-v3large-v3 převedený pro engine faster-whisper; rychlejší a šetrnější k paměti.
medium, small, baseMenší modely Whisper pro počítač bez grafické karty.

Kolem Whisperu jsou tyto servery postavené. Některé z nich umí obsluhovat i jiné modely rozpoznávání řeči, například NVIDIA Parakeet.

Servery s API kompatibilním s OpenAI​

Model musí provozovat server, který nabízí koncový bod /v1/audio/transcriptions kompatibilní s OpenAI. Tyto ho nabízejí:

ServerCo to je
vLLMVýkonný server modelů. Po spuštění obsluhuje Whisper na http://localhost:8000/v1.
SpeachesServer pro řečové modely, „Ollama pro řeč“, postavený na faster-whisper. Model načte, když je o něj poprvé požádán.
whisper.cppEfektivně provozuje Whisper na CPU, včetně Apple silicon. Jeho whisper-server se spouští s --inference-path /v1/audio/transcriptions.
LocalAINáhrada OpenAI, která provozuje modely lokálně.

Stejně funguje každý jiný server, který nabízí stejný koncový bod. Pokud server vyžaduje klíč, zadejte ho jako u cloudové služby.

Než se na server spolehnete, pořiďte zkušební nahrávku a podívejte se na přepis v okně nahrávek: rozhovor v jazyce, který model zná špatně, to prozradí hned.