Switchyard - OpenAI/Anthropic API 그대로 모델을 바꿔 쓰는 LLM 라우터
3 hours ago
2
- NVIDIA NeMo에서 공개한 LLM 라우터로, 모든 요청을 비싼 모델에 맡기는 대신 작업을 처리할 수 있는 더 저렴한 모델을 고르는 것이 목표
- OpenAI Chat Completions/Responses와 Anthropic Messages 형식을 지원해, 기존 클라이언트의 연결 주소를 프록시로 바꾸고 요청별로 다른 모델을 사용할 수 있음
- 요청을 먼저 분류하거나, 작업 진행 상황을 살피거나, 저렴한 모델의 답변을 평가한 뒤 더 강력한 모델에 다시 맡기는 등 여러 라우팅 전략 제공
- Stage Router는 도구 실행 이력에서 오류, 반복되는 시도와 실제 수정 진행을 살펴 탐색/오류 복구에는 강력한 모델을, 정형적인 작업에는 저렴한 모델을 배정
- 기본적으로 추가 LLM 호출 없이 판단하며, 판단이 모호할 때 LLM 분류기를 사용하도록 설정 가능
- 더 강력한 모델이 실행 모델의 계획과 완료 여부를 검토하는 방식이나, 상위 에이전트와 하위 에이전트에 서로 다른 모델을 배정하는 방식도 지원
- NeMo Relay와 LiteLLM 플러그인으로 연결하거나, Python/Rust 라이브러리로 기존 게이트웨이와 에이전트에 내장 가능
- 라이브러리만 내장하면 모델 선택은 Switchyard가, 실제 호출과 인증/재시도는 기존 애플리케이션이 담당
- 독립 프록시 switchyard-server도 제공하며, Prometheus로 요청 수, 오류, 지연시간, 토큰 사용량과 라우팅 부가 비용을 확인 가능
- 아직 1.0 이전 단계로 핵심 라이브러리는 Beta, 모델 호출/변환과 실행 구성요소는 Alpha이며, 독립 서버는 프로덕션용이 아닌 데모/평가용
- Apache-2.0 라이선스
-
Homepage
-
개발자
- Switchyard - OpenAI/Anthropic API 그대로 모델을 바꿔 쓰는 LLM 라우터