Hacker News가 AI에 제시한 도전 과제 중 무엇이 달성됐는지 투표하기

4 days ago 9

Hacker News 의견들 Humanity's Last Exam이라는 이름이 부적절하다고 썼던 내 댓글이 포함되어 있음. 진정한 마지막 시험이라면 어떤 모습이어야 할지도 제안했는데, 그중 ‘수학 미해결 문제 풀기’는 관련 논란과 별개로 Navier-Stokes에서 확실히 달성됐다고 봄. 다만 기준을 명확히 하자면 내가 제안한 시험 6개 중 통과한 것은 1개뿐임. 17%는 합격점이 아니므로 내 도전 과제는 아직 충족되지 않았음. AI가 생성한 것으로 보이는 요약도 원문을 정확히 반영하지 못함. 조건의 절반만 나열했고, ‘그리고’를 ‘또는’으로 바꿔 놓았음. 시험 내용을 정확히 전달할 수 있어야 한다는 항목도 추가해야 함. 논란이 있다고 인정하면서 동시에 확실히 해결됐다고 하는 건 이상함. 실제로는 서로 별개인 논란도 여러 개 있음! 2023년에 프롬프트만으로 임의의 애플리케이션을 안정적으로 전부 만들고 배포하기까지 20년 걸릴 거라고 예측한 내 댓글도 들어 있음. 약 18년이나 빗나갔음! 내 도전 과제 중 하나는 자체 호스팅 AI가 세금 신고 전체를 처리하되, 나를 곤란하게 만들 오류를 내지 않는 것임. 합법적인 세법의 허점까지 활용하면 가산점을 주겠음. AI가 대신해 줬으면 하는 건 즐거운 활동이 아니라 귀찮은 집안일임. 오랫동안 단순한 적응형 필터와 기초적인 신경망까지 ‘인공지능’으로 불렸던 것도 판단에 도움이 되지 않았음. 기능은 매우 제한적이었고, 좁은 용도에서 어떻게 작동하는지도 별로 신비롭지 않았음. 나도 최근의 열풍을 한참 믿지 않았지만, 최신 모델을 써 보고는 꽤 충격받았음. 1분 만에 복잡한 특수 분야 코드베이스를 이해하고, 불필요한 지적은 거의 없이 미묘한 오류를 찾아냄. 수석급 엔지니어라면 몇 달을 들여도 그보다 적게 해냈을 것이고, Coverity는 비용도 많이 들면서 유효한 결과보다 오탐을 훨씬 많이 냈을 것임. 예측 중 최소 3분의 1은 무엇을 예측하는지 불명확함. 원문을 여러 번 읽어도 기준선이 어디인지 알기 어려워, 이미 달성했는지 판단할 수 없는 항목이 많음. 적어도 이 항목에는 답할 수 있음. https://stoppels.ch/goalposts/?c=40662140. 2024년에 내가 말한 ‘고급 수학’은 Terence Tao라도 Math Overflow 게시물 하나에 들일 정도의 노력으로 풀 수 있는 문제를 뜻하지 않았음. LLM이 ‘생성함수를 고려해 보라’고 제안하는 것과 ...

Read Entire Article