POST /gemini/v1beta/models/{model}:generateContent 是 Gemini 的核心对话接口,支持文本、图像、音频等多模态输入,以及流式输出、工具调用等高级功能。
基础请求
多模态输入
文本 + 图像
文本 + 音频
音频输入会自动触发音频定价模式(适用于 gemini-2.5-flash 等支持音频的模型)。
流式输出
将 action 改为streamGenerateContent 并添加 ?alt=sse 参数:
生成配置
通过generationConfig 控制输出行为:
安全设置
通过safetySettings 调整内容过滤级别:
工具调用
Gemini 支持函数调用(Function Calling):如果你更习惯 OpenAI 的
messages 格式和 tools 定义,可以直接使用 OpenAI 兼容路径(/v1/chat/completions),Rivus AI 会自动完成格式转换。详见《OpenAI 兼容》章节。常见参数
contents:对话内容数组,每个元素包含role和partsgenerationConfig:生成配置(温度、最大 token 数等)safetySettings:安全过滤设置tools:可调用的函数定义systemInstruction:系统指令(部分模型支持)
Rivus AI 会自动处理 token 计数、用量统计和计费,你无需关心底层实现细节。
