Документация/LLM
Gemini 3.1 Pro
1M contextКэширование промптовРассуждение
POST
https://api.sozdai.ai/v1/chat/completions#Сводка цен
#Пример запроса
Стандартный формат OpenAI SDK — просто укажите этот base URL.
bash
curl https://api.sozdai.ai/v1/chat/completions \
-H "Authorization: Bearer $CORRY_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-3.1-pro",
"messages": [{"role": "user", "content": "Hello"}]
}'#Пример ответа
Стандартный объект chat completion, совместимый с OpenAI. Поле model нормализуется к запрошенному имени.
json
{
"id": "chatcmpl-abc123",
"object": "chat.completion",
"model": "gemini-3.1-pro",
"choices": [
{
"index": 0,
"message": { "role": "assistant", "content": "Hello! How can I help you today?" },
"finish_reason": "stop"
}
],
"usage": { "prompt_tokens": 12, "completion_tokens": 9, "total_tokens": 21, "cost": 0.000234, "currency": "USD" }
}Поле стоимости
usage.cost — сумма списания за вызов (в USD); в стриминге приходит в финальном chunk с usage. SDK OpenAI игнорируют это дополнительное поле.
#Кэширование промптов
Для моделей с поддержкой кэша поместите длинный неизменный контент (system, базу знаний) в начало и поставьте точку кэширования. Кэшированная часть может стоить всего 1/10. Попадания в кэш возвращаются в поле usage ответа.
json
{
"model": "gemini-3.1-pro",
"messages": [
{
"role": "system",
"content": [
{ "type": "text", "text": "( long static context ... )", "cache_control": { "type": "ephemeral" } }
]
},
{ "role": "user", "content": "your question" }
]
}Совет по кэшу промптов
Кэш промптов сравнивает префиксы запросов. Размещайте длинный контекст (системные инструкции, инструменты) в начале списка сообщений.
#Рассуждение
Для поддерживающих моделей добавьте reasoning_effort (low / medium / high). Рассуждение возвращается в поле reasoning_content ответа; токены рассуждения тарифицируются по цене вывода.
json
{
"model": "gemini-3.1-pro",
"max_tokens": 2048,
"reasoning_effort": "high",
"messages": [{ "role": "user", "content": "your question" }]
}