Skip to main content
ElevenLabs’ most expressive speech model: 90+ languages, stronger voice likeness, and natural-language audio tags (e.g. [laughs], [said quietly, relieved]). Multi-speaker scripts are performed as one conversation.

Request

Required: text
Optional: similarity_boost, stability, voice_name
Reference inputs take asset ids from POST /v1/uploads or an earlier output’s asset_id. Prices and allowed values come from the live catalog; GET /v1/models/eleven_v4 is always current.