Reasoning models
GPT-5·Claude·HCX-007·Kimi의 모델별 추론 요청 형식과 opaque continuation 계약입니다.
추론(reasoning) 모델은 복잡한 수학·코딩·논리 문제를 풀기 전에 내부 작업을 수행합니다. PleumRouter는 OpenAI, Anthropic, Naver 및 GMI의 모델별 wire 형식을 자동으로 맞추되, signature·encrypted data 같은 continuation 값은 opaque 데이터로만 다룹니다.
동작 방식#
OpenAI의 o-시리즈와 gpt-5.2, gpt-5.4, gpt-5.5, gpt-5.6-sol, gpt-6-sol는 temperature를 제거하고 max_tokens를 max_completion_tokens로 바꿔 전송합니다. 이 변환은 해당 reasoning payload 모델에만 적용됩니다.
gpt-5.4·gpt-5.4-mini·gpt-5.5는 forced reasoning입니다. none은 제거되지만 low/medium/high는 전달됩니다.gpt-5.2·gpt-5.6-sol·gpt-5.6-terra·gpt-5.6-luna는 optional reasoning이라 minimal/none/low/medium/high/xhigh/max를 그대로 전달합니다. GPT-5.6은 추가로 reasoning_mode(standard|pro)와 service_tier를 받을 수 있습니다. 기존 o-시리즈 동작은 바뀌지 않습니다.
Claude는 실제 upstream 모델 ID로 정책을 고릅니다. claude-fable-5는 항상 adaptive thinking을 사용하며 none으로 끌 수 없습니다. Opus 4.8/4.7/4.6 및 Sonnet 5/4.6은 optional adaptive이며 low/medium/high를 adaptive effort로, none을 disabled로 변환합니다. Opus 4.5·Sonnet 4.5·Haiku 4.5·Claude 3.7은 manual budget 모델로 20%/50%/80%(최소 1,024, 최대 32,000, 항상 max_tokens보다 작음)를 사용하며 max_tokens가 1,024 이하면 400을 반환합니다. Claude 3.5 계열에는 native thinking 필드를 보내지 않습니다.
{
"model": "gpt-5.6-sol",
"messages": [
{"role": "user", "content": "Prove that there are infinitely many primes."}
],
"max_completion_tokens": 4096,
"reasoning_effort": "xhigh",
"reasoning_mode": "pro",
"service_tier": "priority"
}요청#
HCX-007은 Naver OpenAI-compatible complete-only 경로에서 optionalreasoning_effort를 받으며 temperature는 최대 1.0으로 제한됩니다.moonshotai/Kimi-K2-Thinking은 forced-thinking GMI 모델이지만 GPT-5 payload 모델이 아닙니다. 따라서 일반 OpenAI-compatible max_tokens와 temperature를 유지하고 max_completion_tokens로 바꾸지 않습니다.
curl https://apirouter.pleum.ai/v1/chat/completions \
-H "Authorization: Bearer plm_..." \
-H "Content-Type: application/json" \
-d '{
"model": "gpt-5.6-sol",
"messages": [
{"role": "user", "content": "Prove that there are infinitely many primes."}
],
"max_tokens": 4096,
"reasoning_effort": "xhigh",
"reasoning_mode": "pro",
"service_tier": "priority"
}'reasoning_details의 signature/data는 해석·마스킹·재생성하지 말고 같은 tool continuation에만 원문 그대로 사용하세요. Anthropic 평문 사고는 반환하지 않습니다. reasoning token breakdown은 관측용이며 completion/total 토큰 또는 과금에 다시 더해지지 않습니다.