接入文档/LLM
Gemini 3.6 Flash
1M context提示词缓存思考模式
POST
https://api.sozdai.ai/v1/chat/completions#价格一览
#示例请求
用标准 OpenAI SDK 格式调用,把 base URL 指到这里即可。
bash
curl https://api.sozdai.ai/v1/chat/completions \
-H "Authorization: Bearer $CORRY_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-3.6-flash",
"messages": [{"role": "user", "content": "Hello"}]
}'#响应示例
标准的 OpenAI 兼容对话补全对象。model 字段会归一化为你请求的名称。
json
{
"id": "chatcmpl-abc123",
"object": "chat.completion",
"model": "gemini-3.6-flash",
"choices": [
{
"index": 0,
"message": { "role": "assistant", "content": "Hello! How can I help you today?" },
"finish_reason": "stop"
}
],
"usage": { "prompt_tokens": 12, "completion_tokens": 9, "total_tokens": 21, "cost": 0.000234, "currency": "USD" }
}费用字段
usage.cost 是本次调用的扣费金额(美元);流式模式下会在末尾带 usage 的那个 chunk 里返回。OpenAI SDK 会忽略这个额外字段,不影响兼容。
#提示词缓存
该模型使用自动(隐式)缓存 —— 相同的提示前缀会被上游自动缓存、并按更低的价格计费,无需任何参数(不用 cache_control)。把长而稳定的内容(system 提示、工具定义)放在消息开头即可命中。
自动 — 无需操作
缓存命中会体现在返回的 usage(cached tokens)里,费用自动下降。
#思考模式
支持思考的模型,加上 reasoning_effort 参数即可(low / medium / high)。思考过程返回在响应的 reasoning_content 字段;思考 token 按输出价计费。
json
{
"model": "gemini-3.6-flash",
"max_tokens": 2048,
"reasoning_effort": "high",
"messages": [{ "role": "user", "content": "your question" }]
}