Быстрый старт
Первый ответ за две минуты.
1. Получите ключ API
2. Отправьте запрос
Задайте SARA_API_KEY в окружении, затем вызовите эндпоинт чата:
curl https://api.sara-ai.kz/v1/chat/completions \
-H "Authorization: Bearer $SARA_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gemma-4-31b",
"messages": [{"role": "user", "content": "Hello!"}],
"stream": true
}'3. Включение режима рассуждений (необязательно)
Модели Gemma и GLM могут рассуждать пошагово перед формированием ответа. Этот режим управляется полем запроса reasoning. При использовании Python SDK передавайте его в extra_body.
gemma-4-31b: режим рассуждений по умолчанию выключен. Чтобы включить его, передайте"reasoning": {"enabled": true}.glm-5.2-744b: режим рассуждений по умолчанию включён. Чтобы отключить его, передайте"reasoning": {"enabled": false}. Это сокращает время ответа и стоимость запроса.glm-5.2-744bтакже поддерживает уровни усилия:low,mediumиhigh. Например,"reasoning": {"effort": "low"}запрашивает более короткие рассуждения. Уровень усилия носит рекомендательный характер и не ограничивает расход токенов; для жёсткого ограничения используйтеmax_tokens.
curl https://api.sara-ai.kz/v1/chat/completions \
-H "Authorization: Bearer $SARA_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gemma-4-31b",
"messages": [{"role": "user", "content": "Is 9.11 bigger than 9.9?"}],
"reasoning": {"enabled": true}
}'
# thinking: choices[0].message.reasoning_content
# answer: choices[0].message.contentРассуждения возвращаются в поле reasoning_content, отдельно от ответа в поле content. В потоковом режиме они передаются в delta.reasoning_content.
Токены рассуждений тарифицируются как выходные токены. Если вы задаёте max_tokens, предусмотрите достаточный запас: при низком лимите модель может израсходовать его на рассуждения и вернуть пустой ответ.