Ember-1

2 hours ago 1

Fireworks Research가 Kimi K3 기반 특화 모델 Ember-1을 공개함. 불필요한 추론을 줄이도록 학습해 K3 수준의 품질을 유지하면서 토큰 사용량을 40% 절감하는 모델임 단순히 추론 강도를 낮추면 품질 손실이 커지는 문제를 별도 학습으로 해결함. 오류를 바로잡는 자기 성찰은 유지하고, 불필요한 추론과 비생산적인 반복을 줄이는 데 초점을 맞춤 공개 벤치마크와 고객 2곳의 프로덕션 테스트에서 추론 길이를 35~50% 단축하면서 정확도를 유지함. 다만 개별 벤치마크 점수는 K3 최대 추론 설정보다 높거나 소폭 낮았음 고객의 실제 코딩 작업 A/B 테스트에서는 비슷한 품질로 작업당 토큰을 약 35% 절감함. 고객 1곳은 테스트 후 실제 서비스에 도입했으며, 기본 모델을 전면 대체하도록 사용을 확대할 계획임 Serverless Research Preview로 Kimi K3와 함께 제공함. 연구 모델은 우선 2주간 접근을 허용한 뒤 커뮤니티 수요에 따라 상시 제공 여부를 결정함 긴 추론이 만드는 비용과 Ember-1의 목표 Ember-1은 Fireworks Research의 첫 자체 특화 모델로, Kimi K3의 코딩 능력을 더 낮은 비용으로 사용하려는 요구에서 출발함 K3의 긴 추론 과정은 대규모 자동 코딩 비용을 높였으며, 추론 강도를 낮추는 설정만으로는 품질 손실이 너무 컸음 외부 벤치마크, 고객 A/B 테스트, 내부 코딩 및 에이전트 작업에서 토큰 절감과 품질 유지를 검증함 Kimi K3 같은 추론 모델은 생성 토큰의 대부분을 내부 추론에 쓰며, 그 비중이 90%를 넘기도 함 여러 턴으로 이어지는 에이전트 작업에서는 이전 추론 전체가 매번 모델에 다시 입력됨 초기 턴의 긴 추론을 이후 호출마다 다시 읽고 비용을 청구하므로, 턴 수에 따라 문맥이 대략 제곱에 비례해 늘어남 실험에서는 K3가 작업에 필요한 것보다 훨씬 긴 추론을 생성했으며, 최종 답변을 바꾸지 않고도 불필요한 부분을 제거할 수 있었음 유용한 자기 성찰은 유지하는 학습 모든 추론이 낭비는 아니며, 자기 성찰은 잘못된 가정을 재검토하고 피드백에 대응하거나 결과를 이전 결정과 연결해 오류를 복구하는 데 도움이 됨 학습 목표는 이 능력을 보존하면서 불필요한 추론과 비생산적인 반복을 줄이는 것임 에이전트 작업에서는 가능한 행동을 탐색하고 새로운 관찰을 반영하며, 결정과 결과를 연결하는 피드백으로 추론을 개선함 학습 데이터는 수학, 코딩, ...

Read Entire Article