Voice

Overview

Text to speech, streaming, speech to text, cloning, and speech to speech. OpenAI and ElevenLabs request shapes, one key.

Last reviewed 2026-08-25

Two request shapes

Every voice route accepts both Authorization: Bearer ms_… and xi-api-key: ms_…, so the openai and elevenlabs SDKs both work with a base URL change. Request and response bodies match the OpenAI and ElevenLabs schemas.

CapabilityOpenAI shapeElevenLabs shape
Text to speechPOST /openai/v1/audio/speechPOST /elevenlabs/v1/text-to-speech/{voice_id}, /stream, /with-timestamps, /stream/with-timestamps
Streamingstream_format: "sse"WS /elevenlabs/v1/text-to-speech/{voice_id}/stream-input
Speech to textPOST /openai/v1/audio/transcriptions, POST /openai/v1/audio/translationsPOST /elevenlabs/v1/speech-to-text
Voicesvoice name in the requestGET /elevenlabs/v1/voices, /{voice_id}, /settings/default, /{voice_id}/settings
Voice CloningPOST /elevenlabs/v1/voices/add, /{voice_id}/edit, /settings/edit, DELETE, samples
Voice ChangerPOST /elevenlabs/v1/speech-to-speech/{voice_id}, /stream
HistoryGET /elevenlabs/v1/history, /{item_id}, /{item_id}/audio, DELETE
AccountGET /elevenlabs/v1/user, GET /elevenlabs/v1/user/subscription

Models

Model idNameLicenseGPU classCloning
kokoro-82mKokoro 82MApache-2.0RTX 4090Preset voices
chatterboxChatterboxMITRTX 4090Yes
chatterbox-vcChatterbox Voice ConversionMITRTX 4090Preset voices

Preset voices use kokoro-82m. Cloned voices use chatterbox. Voice Changer uses chatterbox-vc. ElevenLabs eleven_* model ids and OpenAI tts-1 names resolve to the right model for the voice you pick.

Voices

27 preset voices. Every ElevenLabs premade id and OpenAI voice name below resolves to one of them, so existing code keeps working. Unknown ids return 404, never a default voice.

Voice idNameVoiceElevenLabs premade idOpenAI name
af_heartHeartfemale, americanRachel 21m00Tcm4TlvDq8ikWAMcoral
af_bellaBellafemale, americanDomi AZnzlk1XvdvUeBnXmlld
af_nicoleNicolefemale, americanAria 9BWtsMINqrJLrRacOk9x
af_sarahSarahfemale, americanSarah EXAVITQu4vr4xnSDxMaL
af_skySkyfemale, americanElli MF3mGyEYCl7XYWbV9V6Oshimmer
af_novaNovafemale, americannova
af_alloyAlloyfemale, americanalloy
af_aoedeAoedefemale, americanMatilda XrExE9yKIg1WjnnlVkGX
af_jessicaJessicafemale, americanJessica cgSgspJ2msm6clMCkdW9
af_koreKorefemale, americanLaura FGY2WhTYpPnrIDTdsKH5
af_riverRiverfemale, americanRiver SAz9YHcvj6GT2YYXdXww
am_adamAdammale, americanJosh TxGEqnHWrfWFTfGW9XjX, Adam pNInz6obpgDQGcFmaJgB
am_michaelMichaelmale, americanAntoni ErXwobaYiN019PkbXgAt, Chris iP95p4xoKVk53GoZ742Bverse
am_echoEchomale, americanWill bIHbv24MWmeRgasZH58oecho
am_ericEricmale, americanSam yoZ06aMxZJJ28mfd3POQ, Eric cjVigY5qzO86Huf0OWal
am_liamLiammale, americanLiam TX3LPaxmHKxFdv7VOQHJ
am_onyxOnyxmale, americanRoger CwhRBWXzGAHq8TQ4Fs17, Brian nPczCjzI2devNBz1zQrbash, onyx
am_fenrirFenrirmale, americanArnold VR6AewLTigWA4xSOukaG
am_puckPuckmale, americanCharlie IKne3meq5aSn9XLyUdCD
bf_emmaEmmafemale, britishCharlotte XB0fDUnXU5powFXDhCwasage
bf_isabellaIsabellafemale, british
bf_aliceAlicefemale, britishAlice Xb7hH8MSUJpSbSDYk0k2
bf_lilyLilyfemale, britishLily pFZP5JQG7iQjIQuC4Bku
bm_georgeGeorgemale, britishGeorge JBFqnCBsd6RMkjVDRZzb, Bill pqHfZKP75CvOlQylNhV4
bm_lewisLewismale, britishCallum N2lVS1w4EtoT3dr4eOWO
bm_danielDanielmale, britishDaniel onwK4e9ZLuTAKqWW03F9
bm_fableFablemale, britishballad, fable

Output formats

Every ElevenLabs output_format value is accepted: mp3_{22050|24000|44100}_{32..192}, pcm_{8000..48000}, opus_48000_{32..192}, ulaw_8000, alaw_8000, wav_*. OpenAI response_format values map onto it:

response_formatServed as
mp3mp3_44100_128
opusopus_48000_64
aacmp3_44100_128
flacwav_24000
wavwav_24000
pcmpcm_24000

Audio streams from the first chunk on every route.

Pricing

ModelModel idPriceUnit
Kokoro 82Mkokoro-82m$3.00 per 1M charactersInput characters
Chatterboxchatterbox$6.00 per 1M charactersInput characters
Chatterbox Voice Conversionchatterbox-vc$0.060 per minuteInput audio, billed per second

On this page

Share feedback