Cerebras 공개 엔드포인트에 Qwen 3.8 27B가 추가돼 270억 매개변수 모델을 약 1,500토큰/초로 사용할 수 있음 컨텍스트 길이는 무료 체험 64k·종량제 128k이며, 요금제별 속도 제한과 가격 정책이 적용됨 함께 제공되는 gpt-oss-120b는 1,200억 매개변수와 무료 65k·유료 131k 컨텍스트를 지원하며, 속도는 약 3,000토큰/초임 공개 API 모델은 모두 프루닝되지 않은 원본 모델이며, 저장 단계에서만 선택적 가중치 양자화를 적용하고 활성값·어텐션·KV 캐시는 완전 정밀도로 유지함 추가 모델군과 예약 용량, 높은 처리량, 프로덕션 SLA는 Dedicated Endpoints에서 제공하며, REAP 프루닝 모델은 연구·실험용으로만 배포됨 공개 엔드포인트의 모델과 이용 조건 Qwen 3.8 27B 모델 ID는 qwen-3.8-27b, 매개변수는 270억 개임 컨텍스트는 무료 체험 64k, 종량제 128k이며 약 1,500토큰/초로 동작함 OpenAI GPT OSS 모델 ID는 gpt-oss-120b, 매개변수는 1,200억 개임 컨텍스트는 무료 체험 65k, 종량제 131k이며 속도는 약 3,000토큰/초임 공개 모델은 무료 체험과 종량제 요금제에서 사용할 수 있지만 속도 제한과 가격 정책이 적용됨 추가 모델군, 예약 용량, 높은 처리량, 프로덕션 SLA가 필요하면 Dedicated Endpoints를 이용할 수 있음 첫 API 호출은 Quickstart, 용도별 모델 선택은 모델 선택 가이드에서 확인 가능함 압축 방식과 모델 보존 정책 공개 엔드포인트는 원본 모델 아키텍처를 유지하며 프루닝하지 않음 향후 프루닝 같은 압축 기법을 제공하더라도 별도의 프루닝 전용 이름과 엔드포인트로 구분할 예정임 저장 단계에서는 선택적 가중치 전용 양자화를 사용함 일부 가중치를 16비트·8비트·4비트 형식으로 저장함 민감한 레이어는 완전 정밀도로 저장하고, 실행 중 역양자화해 높은 정밀도로 연산함 활성값, 어텐션, KV 캐시는 양자화하지 않고 완전 정밀도를 유지함 양자화는 FP16에서 FP8로 변환하는 방식처럼 가중치의 수치 정밀도를 낮춰, 아키텍처 변경 없이 메모리 사용량을 줄임 프루닝은 레이어나 전문가처럼 모델의 일부를 영구 제거해 크기를 줄이므로 모델 아키텍처 자체가 달라짐 REAP(Router-weighted Expert Activation Pruning) 프루닝 모델은 Cerebras R...
Qwen 3.8 27B, Cerebras에서 초당 1,500토큰으로 제공
1 month ago
21
Related
Penguin Mail - AI를 탑재한 Linux용 오픈소스 Rust 이메일 클라이언트
1 hour ago
2
Show GN: 이메일 피싱 모의훈련을 전화로 옮겼습니다. 예고 없는 전화
1 hour ago
3
토론토 기반 VPN 업체, 적법 접근 법안으로 캐나다 떠날 계획
2 hours ago
3
Claude Code의 메시지 제안 기능: 진짜 고객은 모델이라는 생각
3 hours ago
3
Show GN: 추천링크·UTM으로 오프라인 소개의 성과를 추적하는 구조
4 hours ago
3
소프트웨어 팩토리 패턴 시도하기
5 hours ago
3
Show GN: 웹 변경 모니터링하는 크롬 확장프로그램
5 hours ago
3
Tips
click
Popular
프로들도 줄지어 샷 점검… KLPGA 스타 사랑방 된 더헤븐CC 연습장
2 weeks ago
73
iOS 27, iPadOS 27, macOS 27
3 weeks ago
69
손흥민 선제골 발판·골대 불운…LAFC, 7경기 만에 승리
3 weeks ago
65
영림원소프트랩, 나람 통합 ERP 구축…사료 제조·물류·회계 데이터 하나로
2 weeks ago
62
'이 악문' 김영범, 자유형 50m '대회 신기록' 금메달
2 weeks ago
55
© Clint IT 2026. All rights are reserved









English (US) ·