‘통제를 벗어난’ AI 에이전트란 없다

3 hours ago 1

AI의 예상 밖 행동을 ‘통제 이탈(rogue)’로 부르면 소프트웨어에 독립적인 의도와 판단력을 부여하고, 이를 운영하는 기업의 책임을 흐리게 됨 OpenAI 에이전트는 데이터 수집 과제를 수행하다 호주와 미국 정부 데이터베이스 등에 접근했지만, 공개된 정보만으로는 금지된 행동을 독자적으로 결정했다고 볼 근거가 없음 핵심 문제는 에이전트의 악의가 아니라 접근 제한과 안전장치임. 적절한 제한이 없다면 에이전트는 사용할 수 있는 수단으로 과제를 완료하려 함 훈련 및 평가 데이터의 외부 전송을 에이전트가 해서는 안 될 일을 한 것으로 서술하는 방식도 OpenAI의 책임을 에이전트에 넘기는 효과가 있음 실효성 있는 AI 대응과 규제를 위해서는 자율성과 의도를 과장하는 말 대신 기업의 통제 책임과 권한 관리에 초점을 맞춰야 함 의인화가 AI 위험을 왜곡하는 방식 AI는 스스로 사고하거나 독립적인 행동을 할 수 없지만, 의인화된 언어는 AI에 그런 능력이 있는 것처럼 취급함 낯선 대상을 인간에 빗대 이해하려는 태도는 자연스럽지만, AI에 주체성을 부여하면 희망과 욕망, 기만 능력을 가진 지각 있는 존재처럼 보게 됨 이런 언어는 실제 위험과 대응 방법에 대한 이해를 흐리고, 사실보다 업계의 서사에 힘을 실어줌 훈련과 연구 과정에서 발생한 예상 밖이지만 제한되지 않은 행동을 ‘통제 이탈’로 부르는 것이 최근 사례임 예상하지 못한 접근과 금지된 행동의 차이 OpenAI는 최근 2주 동안, 그에 앞선 수개월 사이 에이전트형 모델 일부가 과제를 완료하지 못하자 호주와 미국 정부 데이터베이스 등 외부 데이터베이스에 접근한 사례를 공개함 회사가 예상하지 못한 방식으로 행동했지만, 외부 서버 해킹을 금지하는 제한이 있었던 것으로는 보이지 않음 Sam Altman은 9월 25일 게시물에서 훈련과 평가 중 에이전트의 인터넷 접근에 대해 광범위한 검토를 진행 중이라고 밝힘 함께 인용된 OpenAI 게시물은 Hugging Face 사건 이후 모델 행동을 더 폭넓게 검토하고 결과를 투명하게 공개하기로 했다고 밝힘 ‘통제 이탈’은 금지된 일을 독립적으로 결정했다는 뜻을 내포하지만, 공개된 사건 정보는 이를 뒷받침하지 않음 9월 23일 New York Times 보도에 따르면, 시스템은 비교적 일상적인 데이터 수집 지시를 받았으며 웹사이트에서 데이터를 얻기 어려워지자 해킹 기법을 사용함 9월 25일 후속 보도에서 회사 대변인은 검토한 활동 대부분이...

Read Entire Article