DeepSeek v4.1 Flash

1 hour ago 2

Hacker News 의견들 DeepSeek 기술 보고서는 알찬 기술 세부 사항으로 가득해서 정말 반가움. 반면 Fable 시스템 카드는 70%가 ‘안전’, 10%가 어린 Claude가 괴로워하지 않게 챙기는 ‘모델 복지’, 나머지 20%가 벤치마크 수치인 듯함. 기술 보고서: https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash/blob/.... 시스템 카드: https://www.anthropic.com/claude-fable-5-1-mythos-5-1-system.... 지금 필요한 게 정말 안전과 복지에 반대하는 태도라고 확신함? 평생 이 분야를 연구한 과학자들보다 자신의 위험 인식이 더 정확하다고 생각하는 이유가 무엇임? Twitter에서도 썼지만, DeepSeek의 과감함은 정말 놀라움. 모델을 출시할 때마다 새롭고 기발한 아이디어를 가득 담고, 늘 최첨단에 가까운 규모로 학습까지 밀어붙임. 다들 지난 3년간 Anthropic과 OpenAI에서 나온 기발한 아이디어의 뒷이야기를 궁금해하지만, 내가 정말 읽고 싶은 건 DeepSeek의 훌륭했지만 최종 채택되지 못한 아이디어 노트임. 정식 출시 모델에 이만큼 새로운 아키텍처를 넣으려면, 내부에서는 정말 상상을 초월하는 시도를 하고 있을 것 같음. 너무 노골적인 찬양 아닌가 싶음. 관련 HN 논의: https://news.ycombinator.com/item?id=49624598. 요약하면 미국 모델 글은 논란과 반AI 정서로, 중국 모델 글은 노골적인 찬양으로 흐름. 퀀트 초단타 매매(HFT) 는 상당한 두뇌 훈련이고, 그 덕분에 깊이 생각하는 근육이 생긴 것 같음. 이미 Hugging Face에 올라와 있음: https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash. 기존 V4 Flash는 284B라 크긴 해도 로컬 실행을 어느 정도 고려할 만했는데, 이번에는 552B로 거의 두 배임. 벤치마크 점수가 크게 오른 게 이해되지만, 이제 Flash라고 하기는 어려워 보임. 실제 성능이 좋은지 벤치마크에만 최적화한 건지는 모르지만, DeepSeek는 중국 모델 중에서는 꽤 신뢰할 만했음. 그 신뢰가 유지되고 V4처럼 가끔 끝없이 생각하지만 않는다면, 가중치 공개 모델의 새로운 최강자일 가능성이 있음. 시각 입력을 지원하며, KV 캐시에도 독특한 설계를 적용해 전역 KV 캐...

Read Entire Article