1. Gemini
HBoom
  • 豆包
    • 视频生成
      • 创建视频生成任务(Seedance 2.0)
      • 查询视频生成任务列表
      • 查询单个视频生成任务
      • 删除视频生成任务
    • 图像生成
      • 图生图
    • 素材管理
      • Seedance SDK 接入示例
      • 真人认证
        • CreateVisualValidateSession 发起真人 H5 认证
        • GetVisualValidateResult 换取真人 GroupId(通常平台内部自动调用)
      • 素材
        • CreateAsset 入库素材(传 URL,异步)
        • GetAsset 查询素材状态(轮询)
        • ListAssets 列出素材(Filter 过滤)
        • UpdateAsset 更新素材(如备注名)
        • DeleteAsset 删除素材
      • 素材分组
        • ListAssetGroups 查询素材资产组合列表
        • CreateAssetGroup 建素材分组(虚拟人像 AIGC)
        • DeleteAssetGroup 删除素材分组
        • GetAssetGroup 查询单个分组信息
        • UpdateAssetGroup 更新分组(名称/描述)
  • 大模型
    • OpenAI
      • gpt-6-astra
      • Chat Completions(OpenAI 对话)
      • Images Generations(文生图)
      • Images Edits(图像编辑)
      • Models(列出平台可用模型)
    • Claude
      • claude-fable-5-1
    • Gemini
      • generateContent(流式)
        POST
      • gemini-omni-flash-preview 接口使用文档
        POST
      • generateContent(Gemini 原生)
        POST
      • gemini-3.8-flash
        POST
      • gemini-2.5-computer-use-preview-10-2025
        POST
  • 可灵
    • 文生视频
      POST
    • 查询任务列表
      GET
    • 查询单个任务(文生视频)
      GET
    • 多模态视频生成(omni)
      POST
    • 多图参考生视频
      POST
    • 动作控制生视频
      POST
    • 图生视频(含首尾帧)
      POST
    • 查询单个任务(图生视频)
      GET
    • 视频延长
      POST
    • 多模态视频编辑 · 初始化
      POST
    • 多模态视频编辑
      POST
  • Grok
    • 文生视频
      POST
    • 图生视频
      POST
    • 参考图生视频
      POST
    • 视频编辑
      POST
    • 视频延长
      POST
    • 查询视频结果
      GET
  • Vidu
    • 查询任务生成结果
    • 文生视频1080P有声
    • 图生视频1080P
    • 首尾帧生视频1080P
    • 参考文生视频720P
    • 参考文生图1080p
  • 万相
    • 参考生视频
    • 数字人视频
    • 查询任务
    • wan3.0-video-prime
  • 智谱
    • glm-5.3
    • glm-5.3-flash
  • MiniMax
    • MiniMax-H3_创建 H3-Context-IR 任务
    • MiniMax-H3_创建视频再生成任务
    • MiniMax-H3_取消或删除任务
    • MiniMax-H3_查询任务列表
    • MiniMax-H3_查询任务
    • MiniMax-H3_创建视频生成任务
  • deepseek
    • deepseek-flash
    • deepseek-v4-flash-vision-exp
    • deepseek-v4.1-flash
  • 腾讯混元
    • hy4-preview
  1. Gemini

gemini-omni-flash-preview 接口使用文档

开发中
POST
/v1beta/interactions

gemini-omni-flash-preview 接口使用文档#

说明:下文的 https://接口地址 为占位符,请替换成我们提供给你的实际接口地址。
这个模型不能用常规的 /v1/chat/completions 调用,它走 Google 的 Interactions API,端点是 /v1beta/interactions。既能文本对话,也能文生视频。

一、基础信息#

项目值
接口地址https://接口地址
请求端点POST /v1beta/interactions
完整 URLhttps://接口地址/v1beta/interactions
模型名gemini-omni-flash-preview
内容类型Content-Type: application/json
如果用 /v1/chat/completions 或 :generateContent 调用,会返回错误 only supported in the Interactions API,换成 /v1beta/interactions 端点即可。

鉴权支持两种方式,任选其一#

方式写法
请求头(推荐)加请求头 Authorization: Bearer 你的Key
URL 参数把 key 拼到地址后面 ?key=你的Key,不用带请求头

二、文本对话#

请求:
提问内容放在 input 字段,不是 messages。返回结构(已精简):
{
  "id": "9YZZav-...",
  "status": "completed",
  "model": "gemini-omni-flash-preview",
  "usage": { "total_tokens": 416, "total_input_tokens": 5, "total_output_tokens": 11 },
  "steps": [
    { "type": "thought",      "summary": [ { "text": "模型的思考过程...", "type": "text" } ] },
    { "type": "model_output", "content": [ { "text": "我是一个由 Google 训练的大型语言模型。", "type": "text" } ] }
  ]
}
回答文字在 steps 数组里 type == "model_output" 那一项的 content[].text。type == "thought" 是思考过程。

三、文生视频#

请求:
参数说明
response_format.type填 "video" 表示生成视频
response_format.aspect_ratio画面比例,已测通 "16:9"
返回结构(已精简):
{
  "status": "completed",
  "usage": { "total_tokens": 58393,
             "output_tokens_by_modality": [ { "modality": "video", "tokens": 57920 } ] },
  "steps": [
    { "type": "thought" },
    { "type": "model_output", "content": [
        { "type": "video", "mime_type": "video/mp4", "data": "<base64 视频数据>" }
    ] }
  ]
}
视频在 steps 里 type == "model_output" 的 content[].data,是一段 base64 编码的 mp4,解码保存成 .mp4 文件即可播放。本次测试生成的文件为 3.1 MB,经 file 校验为标准 ISO Media MP4。

四、异步调用(background)#

生成视频较慢,可用异步方式:提交时加 "background": true,接口立即返回一个任务 id 和 in_progress 状态,之后凭 id 轮询查结果。
第一步,提交任务:
立即返回:
{
  "id": "video-970e6feb-4abd-4a63-ad53-89479924ada4",
  "status": "in_progress",
  "object": "interaction"
}
第二步,用返回的 id 轮询查询(GET):
status 为 in_progress 表示还在生成,隔几秒再查;变为 completed 后,返回结构与同步调用一致,视频在 steps 里 type=="model_output" 的 content[].data(base64 的 mp4)。本次实测轮询约 30 秒完成,取回文件 2.5 MB。

五、Python 完整示例#


六、计费(看 usage 字段)#

每次返回都带 usage,按 token 计费,分模态统计。本次实测数据:
调用total_tokens输出模态
文本对话416text 11
文生视频58393video 57920
文生视频的视频输出 token 远高于文本,调用前请留意 usage。

七、要点#

1.
端点是 /v1beta/interactions,不是 /v1/chat/completions。
2.
鉴权两种方式:请求头 Authorization: Bearer,或 URL 加 ?key=,任选其一。
3.
输入放 input,不是 messages。
4.
输出在 steps 里 type=="model_output" 那一项,type=="thought" 是思考过程。
5.
要视频就加 response_format: {type:"video", aspect_ratio:"16:9"},取 base64 解码存 mp4。
6.
视频慢,可加 background:true 异步提交,再凭返回的 id 轮询查结果。
7.
文生视频 token 消耗大,调用前看 usage。

请求参数

Authorization
Bearer Token
在 Header 添加参数
Authorization
,其值为在 Bearer 之后拼接 Token
示例:
Authorization: Bearer ********************
or
API Key
在 header 添加参数
x-api-key
示例:
x-api-key: ********************
or
Query 参数

Header 参数

Body 参数application/json必填

示例
{
    "model": "gemini-omni-flash-preview",
    "input": "用一句话介绍你自己",
    "response_format": {
        "type": "video",
        "aspect_ratio": "16:9"
    },
    "background": false
}

请求示例代码

Shell
JavaScript
Java
Swift
Go
PHP
Python
HTTP
C
C#
Objective-C
Ruby
OCaml
Dart
R
请求示例请求示例
Shell
JavaScript
Java
Swift
curl --location '/v1beta/interactions?model=gemini-omni-flash-preview&input%20%20%20=%E7%94%A8%E4%B8%80%E5%8F%A5%E8%AF%9D%E4%BB%8B%E7%BB%8D%E4%BD%A0%E8%87%AA%E5%B7%B1&response_format%20=undefined&response_format.type%20%20=video&response_format.aspect_ratio=16%3A9&background%20%20%20%20=false' \
--header 'Authorization: Bearer <token>' \
--header 'Content-Type: application/json' \
--data '{
    "model": "gemini-omni-flash-preview",
    "input": "用一句话介绍你自己",
    "response_format": {
        "type": "video",
        "aspect_ratio": "16:9"
    },
    "background": false
}'

返回响应

🟢200成功
application/json
Bodyapplication/json

示例
{}
修改于 2026-07-22 01:21:43
上一页
generateContent(流式)
下一页
generateContent(Gemini 原生)
Built with