Skip to main content
Google’s conversational video model (preview): text/image-to-video with native audio, plus natural-language refinement of a previous generation. 720p, ~10s clips, model-chosen duration.

Request

Required: prompt
Optional: aspect_ratio, first_frame, reference_images, source_video
Reference inputs take asset ids from POST /v1/uploads or an earlier output’s asset_id. Prices and allowed values come from the live catalog; GET /v1/models/gemini-omni-flash-preview is always current.