livenerf는 모델 출시 후 성능이 조용히 떨어지는지 확인하기 위해, 고정된 문제와 실행 환경으로 매일 측정하고 기준선 대비 변화를 통계적으로 추적하는 벤치마크임 측정 대상은 원시 API 모델이 아니라 Claude Code 구독 경로의 Opus 5.5이며, 모델 자체의 비결정성 대신 프롬프트, CLI, 채점기를 고정하고 원본 로그를 보존함 후보 2,336문항에서 정답 여부가 오가는 78문항을 선정했으며, 하루 한 번 실행하는 설계의 최소 탐지 가능 정확도 변화는 10일 구간당 약 7.5%p임 성능 변화 판정에는 연속된 두 10일 구간의 99% 신뢰구간, 최소 3%p의 효과, 대조 모델에서 같은 변화가 없다는 조건이 필요함 2026년 9월 29일 기준 30일 중 6일치만 수집해 아직 하향 여부를 판정하지 않았으며, 검증에서도 Opus 5로의 교체처럼 작은 차이는 통계적으로 구별하지 못함 측정 목적과 범위 livenerf는 “출시 후 모델이 나빠지는가”라는 한 가지 질문에 집중하는, 결과를 추가만 하는 장기 벤치마크임 Anthropic이 출시 며칠 또는 몇 주 뒤 모델 성능을 낮춘다는 의혹에는 양자화, 같은 이름 뒤의 더 작은 모델, 추론 노력 감소, 라우팅 변경 등이 포함됨 실제 변화 없이 잡음에서 패턴을 찾았을 가능성도 있어, 비교 가능한 초기 기준선과 반복 측정이 필요함 README에 기재된 Claude Opus 5.5 출시일은 2026년 9월 22일이며, 실제 시계열 수집은 출시 약 2.5일 뒤인 9월 24일 22:10 UTC에 시작함 v0는 API 키 없이 Claude Max 구독과 헤드리스 Claude Code의 claude -p를 사용함 claude -p를 실행할 수 있는 환경이면 사용할 수 있으며, Python 3.11 이상이 필요함 영국 AI Security Institute의 오픈소스 평가 프레임워크 Inspect를 기반으로 함 측정 범위는 구독을 통해 제공되는 Claude Code의 Opus 5.5이며, 원시 API 모델과 동일하지 않음 출시 초기 기준선은 절대적인 정답이 아님 새로운 서빙 스택, 용량 부담, 출시 버그 때문에 출시 주간이 오히려 가장 나쁠 수도 있음 2025년 품질 사고는 의도적 하향이 아니라 인프라 버그로 밝혀졌으며, livenerf도 원인을 가정하지 않고 개선과 악화를 모두 측정함 문제 패널 선정과 탐지 능력 GPQA Diamond, MMLU-Pro, 경시 수학, AIM...
Livenerf - Opus 5.5는 벌써 성능이 하향됐을까?
1 week ago
14
Related
AnyPS5 - 에뮬레이션 없이 PS5 바이너리를 PC로 포팅하는 도구(시스템 라이브러리 87% 매핑)
25 minutes ago
0
Show GN: 추천링크·UTM으로 오프라인 소개의 성과를 추적하는 구조
1 hour ago
3
소프트웨어 팩토리 패턴 시도하기
1 hour ago
3
Show GN: 웹 변경 모니터링하는 크롬 확장프로그램
2 hours ago
3
OpenAI, 확률·선택지·점수를 반환하는 Decisions API 공개 베타 시작
2 hours ago
3
제프리 카첸버그 - 세상이 바뀌고 있다: 창의성을 위한 AI
2 hours ago
3
이 모든 것이 지나간 뒤를 위한 지속 가능한 웹 커리어
2 hours ago
3
여러 팀의 시스템을 이해하기 위한 AI 집단 지성 구축하기
3 hours ago
3
Tips
click
Popular
프로들도 줄지어 샷 점검… KLPGA 스타 사랑방 된 더헤븐CC 연습장
2 weeks ago
73
iOS 27, iPadOS 27, macOS 27
3 weeks ago
69
손흥민 선제골 발판·골대 불운…LAFC, 7경기 만에 승리
3 weeks ago
65
영림원소프트랩, 나람 통합 ERP 구축…사료 제조·물류·회계 데이터 하나로
2 weeks ago
62
'이 악문' 김영범, 자유형 50m '대회 신기록' 금메달
2 weeks ago
55
© Clint IT 2026. All rights are reserved









English (US) ·