Strands Decider 2B - 소형 오픈소스 의사결정 모델

1 hour ago 3

Strands Decider 2B는 텍스트 생성 대신 주어진 선택지 중 답을 고르거나 수치 점수를 매기는 20억 매개변수 모델로, 로컬 CPU/GPU 실행과 빠른 실험에 맞춰 개발됨 각 결정에 신뢰도 점수를 제공하고 같은 프롬프트에 대한 여러 질문을 효율적으로 처리하지만, 복잡한 추론과 텍스트 생성 작업에는 적합하지 않음 Qwen3.5-2B의 텍스트 생성 헤드를 포인터 헤드로 교체한 구조이며, 코드와 가중치뿐 아니라 학습 데이터와 학습 스크립트도 공개함 JevBench 공개 세트의 정확도와 보정 성능 평가에서 2B급 33개 모델 중 3위를 기록했으며, 로컬 RTX 3090의 결정 지연 중앙값은 약 115ms임 모델 라우팅, 도구 선택, 가드레일 등에 활용할 수 있으며, 어려운 결정은 LLM에 맡기고 반복적인 쉬운 결정은 소형 모델로 처리해 비용과 지연을 줄이는 하이브리드 에이전트 실험이 진행 중임 의사결정 모델이 하는 일과 한계 에이전트 AI의 실험적 접근을 다루는 strands-labs에 Strands Decider 2B가 추가됨 의사결정 모델, 또는 시스템 1 모델은 TypeSafe AI의 Jev 출시 이후 관심이 커진 모델 유형으로, 임의의 텍스트 대신 제한된 선택지나 수치 점수를 출력함 “turn on the lights”가 커피 머신에 관한 요청인지 예/아니요로 판단함 “sihamba ngokushesha”의 언어를 English, Zulu, Dutch 중에서 고름 “this is the best doc I’ve ever read”의 긍정 감정을 0~1 점수로 매김 출력의 유연성을 줄이는 대신 동일 크기에서 더 빠르고 높은 성능을 얻으며, 선택형 질문에는 반드시 주어진 선택지 중 하나를 반환함 모든 출력을 한 번의 병렬 처리로 계산해 지연 시간을 줄이지만, 복잡한 문제 해결 능력은 추론 모델보다 크게 떨어짐 텍스트를 생성하지 않아 코딩, 챗봇, 문서 요약 등 일반적인 LLM 작업에는 부적합함 각 결정에 고품질 신뢰도 점수를 제공하며, 같은 프롬프트에 여러 질문을 묻는 작업도 효율적으로 처리함 이러한 결정별 신뢰도 점수는 최첨단 LLM 추론 API에서는 제공되지 않음 이 특성은 Strands Harness SDK와 최근 출시된 Strands 하네스로 구축하는 에이전트 워크플로에 잘 맞음 구조와 공개 범위 사전 학습된 Qwen3.5-2B 본체에서 텍스트 생성 헤드(LM head)를 제거하고, 선택지별 점수...

Read Entire Article