Z.ai, Ox Alpha가 새 GLM 시리즈 모델임을 확인하고 가중치 공개 예정

1 month ago 19

Hacker News 의견들 Ox Alpha를 OpenRouter와 OpenCode Zen의 Crush 하네스에서 며칠간 쉬지 않고 코딩 작업에 투입해 보니, 성능은 Sonnet과 Opus 사이 정도였고 실수는 적지만 아주 영리하지는 않았음 가장 큰 문제는 여러 차례 무한 반복에 빠졌다는 것으로, 같은 Bash 명령을 약 1,000번 실행하기도 했음. 이런 문제는 오래된 Mimo 2.5 이후 처음이라 무인 실행이 불가능하고 에이전트로 쓰기 어려움 OpenCode에서 계속 발생하는 네트워크 오류를 넘지 못했음. Claude 사용량이 부족할 때는 제법 쓸 만했지만, 그 이상으로 좋은지 나쁜지는 판단하기 어려웠음 무한 반복은 모델뿐 아니라 하네스의 결함이기도 함. 이 명백한 공백을 해결하려고 직접 만든 것 외에는 이런 상황에 대응하는 오픈소스 하네스를 보지 못했으며, 다른 작업에서는 0x Alpha가 문제없이 계속 실행된 예도 있음 이 모델에는 엄격한 저작권 규칙이 있는 듯함 주로 양자화 모델에서 무한 반복을 보게 됨. 나중에 개선할 수 있는 효율적인 양자화 모델의 실용성을 극대화하려다 품질보다 양을 택한 결과일 가능성이 큼 Ox Alpha를 지난 5일간 자동 실행으로 여러 실험에 투입했는데 매우 인상적이었음 오픈소스 문서와 Hugging Face 데이터셋에서 데이터를 확인할 수 있음: https://openzot.github.io/whetstone/ - https://github.com/openzot/whetstone, https://openzot.github.io/arcade/ - https://github.com/openzot/arcade, https://openzot.github.io/machinery/ - https://github.com/openzot/machinery Ox Alpha 관련 Bloomberg 기사: https://unwall.app/www.bloomberg.com/news/articles/2026-08-2... Unwall.App은 처음 알았는데 상당히 좋아 보이며 Archive.ph보다 나을 수도 있음 평가 결과가 엇갈림. LiveBench에서는 GPT-5.4 Nano보다 낮지만, Ox Alpha 사이트에서는 Fable을 큰 차이로 앞섬. 후자가 사실이어도 여전히 Fable에서 증류했다고 할지 궁금함 Ox Alpha가 Fable급이라는 평가는 소셜미디어의 과장 주기에서 나온 것임. 새로운...

Read Entire Article