Qwen 3.8 27B, Cerebras에서 초당 1,500토큰으로 제공

1 month ago 21

Cerebras 공개 엔드포인트에 Qwen 3.8 27B가 추가돼 270억 매개변수 모델을 약 1,500토큰/초로 사용할 수 있음 컨텍스트 길이는 무료 체험 64k·종량제 128k이며, 요금제별 속도 제한과 가격 정책이 적용됨 함께 제공되는 gpt-oss-120b는 1,200억 매개변수와 무료 65k·유료 131k 컨텍스트를 지원하며, 속도는 약 3,000토큰/초임 공개 API 모델은 모두 프루닝되지 않은 원본 모델이며, 저장 단계에서만 선택적 가중치 양자화를 적용하고 활성값·어텐션·KV 캐시는 완전 정밀도로 유지함 추가 모델군과 예약 용량, 높은 처리량, 프로덕션 SLA는 Dedicated Endpoints에서 제공하며, REAP 프루닝 모델은 연구·실험용으로만 배포됨 공개 엔드포인트의 모델과 이용 조건 Qwen 3.8 27B 모델 ID는 qwen-3.8-27b, 매개변수는 270억 개임 컨텍스트는 무료 체험 64k, 종량제 128k이며 약 1,500토큰/초로 동작함 OpenAI GPT OSS 모델 ID는 gpt-oss-120b, 매개변수는 1,200억 개임 컨텍스트는 무료 체험 65k, 종량제 131k이며 속도는 약 3,000토큰/초임 공개 모델은 무료 체험과 종량제 요금제에서 사용할 수 있지만 속도 제한과 가격 정책이 적용됨 추가 모델군, 예약 용량, 높은 처리량, 프로덕션 SLA가 필요하면 Dedicated Endpoints를 이용할 수 있음 첫 API 호출은 Quickstart, 용도별 모델 선택은 모델 선택 가이드에서 확인 가능함 압축 방식과 모델 보존 정책 공개 엔드포인트는 원본 모델 아키텍처를 유지하며 프루닝하지 않음 향후 프루닝 같은 압축 기법을 제공하더라도 별도의 프루닝 전용 이름과 엔드포인트로 구분할 예정임 저장 단계에서는 선택적 가중치 전용 양자화를 사용함 일부 가중치를 16비트·8비트·4비트 형식으로 저장함 민감한 레이어는 완전 정밀도로 저장하고, 실행 중 역양자화해 높은 정밀도로 연산함 활성값, 어텐션, KV 캐시는 양자화하지 않고 완전 정밀도를 유지함 양자화는 FP16에서 FP8로 변환하는 방식처럼 가중치의 수치 정밀도를 낮춰, 아키텍처 변경 없이 메모리 사용량을 줄임 프루닝은 레이어나 전문가처럼 모델의 일부를 영구 제거해 크기를 줄이므로 모델 아키텍처 자체가 달라짐 REAP(Router-weighted Expert Activation Pruning) 프루닝 모델은 Cerebras R...

Read Entire Article