Sozdai LogoDocs
Документация/LLM

Gemini 3.7 Flash

1.05M contextКэширование промптовРассуждение
POSThttps://api.sozdai.ai/v1/chat/completions

#Сводка цен

#Пример запроса

Стандартный формат OpenAI SDK — просто укажите этот base URL.

bash
curl https://api.sozdai.ai/v1/chat/completions \
  -H "Authorization: Bearer $CORRY_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gemini-3.7-flash",
    "messages": [{"role": "user", "content": "Hello"}]
  }'

#Пример ответа

Стандартный объект chat completion, совместимый с OpenAI. Поле model нормализуется к запрошенному имени.

json
{
  "id": "chatcmpl-abc123",
  "object": "chat.completion",
  "model": "gemini-3.7-flash",
  "choices": [
    {
      "index": 0,
      "message": { "role": "assistant", "content": "Hello! How can I help you today?" },
      "finish_reason": "stop"
    }
  ],
  "usage": { "prompt_tokens": 12, "completion_tokens": 9, "total_tokens": 21, "cost": 0.000234, "currency": "USD" }
}

Поле стоимости

usage.cost — сумма списания за вызов (в USD); в стриминге приходит в финальном chunk с usage. SDK OpenAI игнорируют это дополнительное поле.

#Кэширование промптов

Эта модель использует автоматическое (неявное) кэширование — повторяющиеся префиксы промпта кэшируются автоматически по сниженной цене, без cache_control. Держите длинный стабильный контекст в начале сообщений.

Автоматически

Попадания в кэш отражаются в usage (cached tokens) и автоматически снижают стоимость.

#Рассуждение

Для поддерживающих моделей добавьте reasoning_effort (low / medium / high). Рассуждение возвращается в поле reasoning_content ответа; токены рассуждения тарифицируются по цене вывода.

json
{
  "model": "gemini-3.7-flash",
  "max_tokens": 2048,
  "reasoning_effort": "high",
  "messages": [{ "role": "user", "content": "your question" }]
}