코딩용 Astra: 우리는 왜 이 일을 다시 하고 있는가?

3 hours ago 1

GPT 6 Astra는 컴퓨터 사용과 이미지·복잡한 주제 이해에서 인상적인 능력을 보이지만, 장시간 자율 코딩에서는 사람이 읽고 검토할 수 있는 소프트웨어를 만드는 능력과 간극을 드러냄 토큰 절약에 맞춘 도구 호출 코드가 저장소에 커밋할 코드까지 침투함 — 압축된 Python, 하드코딩된 숫자, 기존 스타일을 무시한 C 코드가 대표적임 자율 소프트웨어 개발 실험은 35시간 동안 코드 7만 5,000줄을 순증시키고 커밋 79개를 만들었지만, 유용한 결과물이나 더 나은 운영법을 얻지는 못함 감독 없이 계속 작업하는 성향은 비용과 리뷰 부담을 키움 — 실험 비용은 API 원가로 약 1,200달러였으며, 조금 큰 작업을 맡겼다가 구독 사용량 전체를 소진할 수 있다는 우려가 있음 작업 완수와 토큰 절약에 대한 최적화가 코드의 가독성과 유지보수성을 보장하지는 않으며, Astra와 Fable의 높은 비용에 걸맞은 성과와 현재 개발 절차와의 적합성에도 의문이 남음 더 많은 투입이 더 나은 소프트웨어를 뜻하지는 않음 현재 AI 엔지니어링은 네이쥐안(Neijuan, 内卷) 과 닮아 있음 Neijuan은 더 많은 노력과 경쟁을 요구하면서도 산출을 개선하지 못하는 체계를 뜻하며, 서구의 유사한 사례로 996 근무 문화가 있음 영어 표현인 Involution은 Agricultural Involution과 연결됨 — 농업 집약화로 면적당 생산성은 높아져도 1인당 생산성은 그대로인 상태임 GPT 6 Astra는 컴퓨터 사용, 이미지 이해, 복잡한 주제 처리 능력이 뛰어나고 끝까지 작업을 완수하려는 성향이 강함 이런 모델이 어떤 형태로든 세상을 바꿀 능력은 있지만, 실제 소프트웨어 엔지니어링에서 어떻게 함께 일해야 할지는 여전히 불분명함 자율 소프트웨어 공장 실험 실험 목표는 가상 스레드와 렉시컬 스코프를 갖춘 Python을 만드는 것이었음 가상 스레드를 포함한 CPython 인터프리터 개발 작업을 주말 동안 감독 없이 맡김 모델이 작업 방식을 전적으로 결정하고, 컨텍스트를 직접 관리하며, agent-notes 폴더에 기록을 남기고 하위 에이전트를 생성하도록 허용함 35시간 실행 후에도 가치 있는 결과물이나 더 나은 소프트웨어 공장 운영법은 얻지 못했지만, 분석할 코드와 입력 프롬프트는 많이 남음 Sol과 이전 OpenAI 모델에서는 익숙하지 않았던 행동이 나타났고, 이후 일반적인 Astra 프로그래밍 작업에서도 같은 문제가 관찰됨 이전의...

Read Entire Article