본문으로 건너뛰기

Auto

모델 선택을 Auto 하나에게 맡깁니다. 요청마다 지금 가장 잘하는 모델이 붙습니다.

"model": "auto"로 요청하면, Pleum이 요청 의도(코드·추론·비전·번역 등)를 판정해 그 작업에 가장 좋은 모델로 치환합니다. 모델 이름을 몰라도 되고, 새 모델이 카탈로그에 추가되면 별도 설정 없이 후보에 자동으로 들어옵니다.

auto — quickstart
curl https://apirouter.pleum.ai/v1/chat/completions \
  -H "Authorization: Bearer plm_..." \
  -H "Content-Type: application/json" \
  -d '{
    "model": "auto",
    "messages": [
      {"role": "user", "content": "Write a Python function to dedupe a list."}
    ]
  }'

동작 방식#

요청 본문에서 의도를 분류하고(무전송·정규식 기반), 그 분야의 최고 모델을 골라 1회 호출합니다.실제 과금은 치환된 실제 모델 기준으로 청구됩니다 — auto 자체는 가상 모델이라 단가가 없습니다.

선택 순위는 3단계입니다. ① PleumRouter 실제 트래픽에서 관측된 성적(주간 집계) → ② 주간 벤치마크 점수표(LMArena) → ③ 카탈로그 정적 매핑. 어떤 단계에서 실패해도 다음 단계로 내려가므로 라우팅이 멈추지 않습니다.

폴백 체인#

선택된 모델이 일시적으로 비활성화되면 동일 분야의 차상위 모델로, 그것도 없으면 general 분야로 폴백합니다. 홀드(credit hold) 전에 판정하므로 실패해도 과금이 발생하지 않습니다.

내가 고른 모델 풀 안에서만 자동 선택을 돌리고 싶다면 라우팅 정책을, 정확도 최우선으로 여러 모델을 병렐 검증하려면 오케스트레이터를 보세요.