Sozdai LogoDocs
接入文档/LLM

Gemini 3.1 Pro

1M context提示词缓存思考模式
POSThttps://api.sozdai.ai/v1/chat/completions

#价格一览

#示例请求

用标准 OpenAI SDK 格式调用,把 base URL 指到这里即可。

bash
curl https://api.sozdai.ai/v1/chat/completions \
  -H "Authorization: Bearer $CORRY_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gemini-3.1-pro",
    "messages": [{"role": "user", "content": "Hello"}]
  }'

#响应示例

标准的 OpenAI 兼容对话补全对象。model 字段会归一化为你请求的名称。

json
{
  "id": "chatcmpl-abc123",
  "object": "chat.completion",
  "model": "gemini-3.1-pro",
  "choices": [
    {
      "index": 0,
      "message": { "role": "assistant", "content": "Hello! How can I help you today?" },
      "finish_reason": "stop"
    }
  ],
  "usage": { "prompt_tokens": 12, "completion_tokens": 9, "total_tokens": 21, "cost": 0.000234, "currency": "USD" }
}

费用字段

usage.cost 是本次调用的扣费金额(美元);流式模式下会在末尾带 usage 的那个 chunk 里返回。OpenAI SDK 会忽略这个额外字段,不影响兼容。

#提示词缓存

对支持缓存的模型,把固定不变的长内容(system、知识库)放在最前面,并打上缓存断点。命中缓存的部分计费可低至 1/10。缓存命中情况会通过响应的 usage 字段返回。

json
{
  "model": "gemini-3.1-pro",
  "messages": [
    {
      "role": "system",
      "content": [
        { "type": "text", "text": "( long static context ... )", "cache_control": { "type": "ephemeral" } }
      ]
    },
    { "role": "user", "content": "your question" }
  ]
}

提示缓存小贴士

提示缓存按请求前缀精确匹配。请把长上下文(如系统指令、工具定义)放在消息列表的最前面。

#思考模式

支持思考的模型,加上 reasoning_effort 参数即可(low / medium / high)。思考过程返回在响应的 reasoning_content 字段;思考 token 按输出价计费。

json
{
  "model": "gemini-3.1-pro",
  "max_tokens": 2048,
  "reasoning_effort": "high",
  "messages": [{ "role": "user", "content": "your question" }]
}