Жылдам бастау
Екі минуттың ішінде алғашқы сұранысты жіберіп көріңіз.
1. API кілтін алыңыз
Басқару тақтасында кілт жасау →
2. Сұраныс жіберіңіз
Терминалда SARA_API_KEY айнымалысын көрсетіп, /chat/completions-ке сұраныс жасап көріңіз:
curl https://api.sara-ai.kz/v1/chat/completions \
-H "Authorization: Bearer $SARA_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gemma-4-31b",
"messages": [{"role": "user", "content": "Hello!"}],
"stream": true
}'3. Пайымдау режимін қосу (міндетті емес)
Gemma және GLM моделдері жауап бермес бұрын ойын тізбектеп, қадам-қадаммен пайымдай алады. Бұл режим reasoning сұраныс өрісі арқылы реттеледі. Python SDK қолданғанда оны extra_body параметріне беріңіз.
gemma-4-31b: пайымдау режимі әдепкіде өшірулі болады. Оны қосу үшін"reasoning": {"enabled": true}параметрін беріңіз.glm-5.2-744b: пайымдау режимі әдепкіде қосулы болады. Оны өшіру үшін"reasoning": {"enabled": false}параметрін беріңіз. Бұл жауап қайтару уақытын тездетіп, сұраныс құнын арзандатады.glm-5.2-744bсонымен қатар күш салу деңгейлерін де қолдайды:low,mediumжәнеhigh. Мысалы,"reasoning": {"effort": "low"}параметрі неғұрлым ықшам пайымдауды сұрайды. Бұл деңгей тек ұсыныс ретінде жұмыс істейді және токен шығынын шектемейді; қатаң шектеу қою үшінmax_tokensөрісін пайдаланыңыз.
curl https://api.sara-ai.kz/v1/chat/completions \
-H "Authorization: Bearer $SARA_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gemma-4-31b",
"messages": [{"role": "user", "content": "Is 9.11 bigger than 9.9?"}],
"reasoning": {"enabled": true}
}'
# thinking: choices[0].message.reasoning_content
# answer: choices[0].message.contentПайымдау нәтижесі content өрісіндегі жауаптан бөлек, reasoning_content өрісінде қайтарылады. Стриминг (поток) режимінде олар delta.reasoning_content ішінде беріледі.
Пайымдау токендері шығыс (output) токендері ретінде тарифтеледі. Егер max_tokens мәнін орнатсаңыз, жеткілікті лимит қарастырыңыз: лимит төмен болса, модель барлық токенді пайымдауға жұмсап, негізгі жауапты бос қайтаруы мүмкін.