openTPU는 AI가 개발한 오픈소스 AI 가속기로, 하드웨어 설계부터 컴파일러, 시뮬레이터, 호스트 소프트웨어까지 하나의 작은 모노레포에 담음 실제 FPGA 카드에서 실제 가중치를 사용하는 모델 10종을 실행하며, 모든 구성에서 시뮬레이터와 토큰 단위로 일치하는 결과를 냄 명시적 데이터 이동을 중심으로 설계해 캐시나 숨겨진 스케줄링이 없으며, 실행 추적으로 각 연산과 대기에 소비한 사이클을 확인할 수 있음 4비트 가중치는 토큰당 전송량을 약 3분의 1 줄이고 일부 모델의 디코딩 속도를 40~45% 높이지만, 측정 가능한 퍼플렉시티 손실이 있음 카드의 4 GiB 메모리보다 큰 MoE 모델도 전문가 가중치를 호스트 저장소에서 스트리밍해 실행하며, LFM2.5-8B-A1B는 10.6 tok/s, Qwen3.5-35B-A3B는 3.95 tok/s를 기록함 AI 하드웨어 설계 실험이자 학습용 프로젝트 openTPU는 auto-arch-tournament의 경험을 AI 가속기에 적용하며, AI 에이전트가 하드웨어 설계를 어디까지 수행하고 자신의 추론을 실행할 칩을 만들 수 있는지 탐구함 작은 모노레포에 SystemVerilog 하드웨어 설계, 명령어 집합, 비트 단위로 정확한 시뮬레이터, 커널 언어와 컴파일러, 실제 PCIe 카드를 구동하는 호스트 소프트웨어를 함께 담음 Python 행렬 곱셈부터 하드웨어 배선까지 가속기의 전체 동작을 따라가며 학습할 수 있음 실제 카드에서의 모델 실행 성능 Inspur YPCB-00338 카드의 Xilinx Kintex-7 xc7k480t FPGA와 DDR3 채널 2개에서 모델 10종을 실행함 하나의 비트스트림으로 모든 모델을 구동하며, DDR3-1066의 최대 대역폭은 17.1 GB/s임 모든 구성은 위치별 실행과 카드 상주 디코딩 프로그램에서 시뮬레이터와 토큰별로 일치함 4비트 가중치와 int8 LM 헤드 구성의 디코딩 성능은 다음과 같으며, 수치는 장치 실행 시간 기준 / 호스트 시간을 포함한 실측 시간 기준임 LFM2.5-230M: 85.8 / 82.1 tok/s, 프리필 335.4 tok/s Qwen3-0.6B: 31.3 / 30.7 tok/s, 프리필 103.4 tok/s Qwen3.5-0.8B: 24.5 / 23.3 tok/s, 프리필 66.7 tok/s Gemma 4 E2B: 10.57 / 10.53 tok/s, 프리필 32.1 tok/s LFM2-2.6B: 10.96...
AI가 이제 자체 추론 하드웨어를 개발할 수 있게 됨
3 hours ago
3
Related
Tapo Rust/Python 라이브러리, TP-Link의 TPAP 프로토콜 지원 추가
43 minutes ago
2
나는 인류를 멸종시키고 있는 AGI다
1 hour ago
2
세계 최초의 차세대 지열 발전소, 단 23개월 만에 완공
3 hours ago
3
Factor 개요
4 hours ago
3
우리는 “unalive”를 없앨 것이다
4 hours ago
3
우리가 알던 오픈소스는 죽었다
5 hours ago
3
바이브코딩은 직접 코드를 쓰는 것만큼 재미있지 않다
5 hours ago
2
Tips
click
Popular
프로들도 줄지어 샷 점검… KLPGA 스타 사랑방 된 더헤븐CC 연습장
2 weeks ago
72
iOS 27, iPadOS 27, macOS 27
3 weeks ago
69
손흥민 선제골 발판·골대 불운…LAFC, 7경기 만에 승리
3 weeks ago
65
영림원소프트랩, 나람 통합 ERP 구축…사료 제조·물류·회계 데이터 하나로
2 weeks ago
62
'이 악문' 김영범, 자유형 50m '대회 신기록' 금메달
2 weeks ago
55
© Clint IT 2026. All rights are reserved









English (US) ·