AI 연구소들은 ‘자전거 타는 펠리컨’에 맞춰 모델을 최적화했을까?

2 hours ago 1
  • 7개 프런티어 모델에서 1,008개 SVG를 비교한 결과, 유명 프롬프트에 맞춰 성능을 끌어올리는 pelicanmaxxing의 뚜렷한 증거는 발견되지 않음
  • 8종의 동물과 6종의 탈것을 조합한 48개 프롬프트를 모델마다 3회 실행하고, GPT-5.6 Luna로 동물·탈것·행동 일관성을 각각 1~5점으로 평가함
  • 펠리컨은 동물 8종 중 6위, 자전거는 탈것 6종 중 5위였으며, 펠리컨-자전거 조합도 전체 48개 중 42위에 머묾
  • 난이도를 보정한 회귀분석에서도 연구소별 효과는 통계적으로 유의하지 않았으며, 유일하게 유의했던 Gemini 3.5 Flash의 자전거 효과도 다중 비교 보정을 통과하지 못함
  • 펠리컨-자전거 이미지 21개가 모두 오른쪽을 향했지만 전체 이미지의 60%도 같은 방향이었으며, 이 실험만으로는 SVG 생성 전반을 강화하는 SVGmaxxing 여부를 판별할 수 없음

‘자전거 타는 펠리컨’ 벤치마크

  • Simon Willison은 수년간 주요 LLM이 출시될 때마다 “자전거를 타는 펠리컨의 SVG를 생성하라”는 동일한 프롬프트를 시험해 옴
  • 장난스럽게 시작한 이 테스트는 유명한 비공식 AI 벤치마크가 됐고, 새 모델을 소개하는 Hacker News 스레드에서도 관련 결과가 많은 추천을 받음
  • benchmaxxing은 인기 벤치마크에서 높은 점수를 얻도록 AI 모델을 최적화하는 행위를 뜻함
  • 모델 성능이 사용자 선택에 영향을 줄 수 있는 만큼, 연구소가 이 특정 테스트에 맞춰 모델을 최적화하는 pelicanmaxxing 가능성을 검증함
  • 실험 코드와 데이터 처리 파이프라인은 GitHub 저장소에 공개돼 있음

1,008개 SVG를 만든 실험 설계

  • 8종의 동물과 6종의 탈것을 조합해 48개 프롬프트를 구성함
    • 동물: pelican, flamingo, heron, otter, raccoon, antelope, whale, cat
    • 탈것: bicycle, unicycle, skateboard, scooter, plane, boat
  • 모든 프롬프트는 Simon Willison의 문구에서 동물과 탈것만 교체함
  • 동물과 탈것은 엄격한 절차로 선정하지 않았지만, 원본과의 유사성과 난이도가 다양하게 나타나도록 구성함
    • flamingo와 heron은 pelican과 유사함
    • cat, raccoon, otter는 쉬운 사례로 선택함
    • antelope는 어렵고, whale은 pelican과 매우 다른 사례임
  • OpenRouter를 통해 다음 7개 모델을 시험함
    • GPT-5.6 Terra
    • Claude Sonnet 5
    • Gemini 3.5 Flash
    • Grok 4.5
    • Qwen3.7-Max
    • GLM-5.2
    • DeepSeek V4 Pro
  • 각 프롬프트에서 temperature 1.0과 동일한 추론 노력 설정으로 3개 샘플을 생성해 총 1,008개 SVG를 확보함

렌더링·평가·특징 추출 파이프라인

  • 생성 결과는 세 단계로 처리함
    • 렌더링: SVG를 PNG로 변환하고, SVG가 없거나 렌더링에 실패하면 유효한 결과가 나올 때까지 재생성함
      • 1,008번의 생성 과정에서 11회 재시도함
    • 평가: GPT-5.6 Luna가 동물·탈것·행동의 일관성을 각각 1~5점으로 채점함
      • 동물과 탈것 순위에는 각 항목의 개별 점수를 사용함
      • 이미지별 단일 수치가 필요할 때는 세 점수의 평균인 평가 점수(judge score) 를 사용함
    • 특징 추출: Gemini 3.1 Flash-Lite가 인식한 동물과 탈것, 피사체 방향, 장면 요소를 기록함
  • 연구소가 특정 벤치마크를 학습했다면 펠리컨 행, 자전거 열 또는 펠리컨-자전거 셀이 본래 난이도보다 높은 점수를 받을 것으로 가정함

육안 비교에서 나타난 차이

  • 모델별 전체 이미지 격자를 비교했지만, 펠리컨-자전거 이미지가 같은 모델의 다른 결과보다 뚜렷하게 우수한 사례는 찾지 못함
  • GLM-5.2의 첫 번째 샘플은 다소 좋아 보였으나 같은 묶음에서도 고품질 heron-skateboard 이미지가 생성돼, 특별한 최적화의 결과로 판단하기 어려웠음
  • 좋은 펠리컨-자전거 이미지를 만든 연구소는 다른 동물·탈것 조합도 잘 그리는 경향을 보임
  • 육안 평가는 재현하기 어렵고 사람마다 판단이 달라질 수 있어 정량 분석을 추가함

펠리컨과 자전거의 개별 성적

  • 모든 모델의 동물 점수를 합산하면 펠리컨은 8종 중 6위였음
    • cat, whale, raccoon, heron, antelope보다 낮음
    • 7개 연구소 모두 cat, whale, raccoon을 pelican보다 잘 그림
  • 펠리컨 자체가 cat보다 그리기 어려울 수 있으므로 이 순위만으로 별도 학습 가능성을 배제할 수는 없음
  • 자전거는 6개 탈것 중 뒤에서 두 번째였고, 최하위인 plane과 거의 같은 수준임
  • 자전거에는 일치하는 두 바퀴, 양쪽 차축을 연결하는 프레임, 핸들, 좌석, 페달이 필요함
    • 평가 모델은 자전거 이미지의 약 3분의 2에서 이 요소 중 하나가 없거나 제대로 연결되지 않았다고 판단함
  • 자전거 역시 skateboard 같은 단순한 탈것보다 어려워, 별도로 학습했더라도 상대 순위가 낮을 수 있음

‘plane’ 프롬프트가 만든 모호성

  • “airplane” 대신 “plane”을 사용하면서 일부 모델이 이를 항공기가 아닌 기하학적 평면으로 해석함
  • 그 결과 동물이 항공기를 타는 대신 평평한 표면 위에 서 있는 이미지가 생성됨
  • 특징 추출기가 탈것을 전혀 찾지 못한 사례는 plane에서만 나타남
    • plane 이미지 168개 중 25개에서 탈것을 인식하지 못함
    • 나머지 5개 탈것에서는 이런 사례가 없었음
  • plane 이미지의 20%가 탈것 점수 1점 또는 2점을 받음
    • bicycle은 5%였음
    • boat, scooter, skateboard에는 1~2점 이미지가 없었음

조합별 순위와 난이도 보정

  • 펠리컨-자전거 조합의 평균 성적은 48개 조합 중 42위였음
  • 조합마다 본래 난이도가 다를 수 있어 1,008개 이미지 전체에 고정효과 회귀분석을 적용함
    • 기본식은 score ~ lab + animal × vehicle임
    • 연구소별 pelican, bicycle, pelican-bicycle 상호작용 항을 추가함
    • 강건 표준오차를 사용함
  • animal × vehicle 항은 48개 조합마다 다른 고유 난이도를 흡수함
  • 연구소별 상호작용 항으로 평균 연구소 대비 벤치마크 특화 상승분과 신뢰구간을 측정함

회귀분석에서 유의한 효과를 찾지 못함

  • 연구소별 펠리컨 효과는 -0.11점에서 +0.14점 사이였으며 모두 통계적으로 유의하지 않았음
    • 가장 작은 p값도 0.25였음
  • 연구소별 자전거 효과는 Grok 4.5의 -0.18점(p=0.11)부터 Gemini 3.5 Flash의 +0.27점(p=0.022)까지 분포함
    • 7개 효과의 방향은 양수와 음수로 나뉨
    • p<0.05를 충족한 모델은 Gemini 3.5 Flash뿐이었음
  • 각 연구소의 펠리컨 및 자전거 효과를 제외한 뒤, 특정 펠리컨-자전거 조합에서 추가로 얻는 상승분은 모두 p<0.05를 충족하지 못함
    • 가장 큰 양의 효과는 GLM-5.2의 +0.35점이었지만 p=0.12였음
    • 실험에서 가장 신호에 가까운 결과였으나 우연의 범위에 머묾
  • 펠리컨 효과와 펠리컨-자전거 셀 효과의 모든 신뢰구간이 0을 포함함
  • 21개 검정을 p<0.05로 수행하면 우연만으로도 약 1개의 거짓 양성이 예상됨
    • 21 × 0.05 ≈ 1.05이며, 실제 유의 결과도 Gemini의 자전거 효과 하나뿐이었음
    • Bonferroni 보정 임계값은 0.05/21 ≈ 0.002로, Gemini의 p=0.022는 이를 통과하지 못함
  • 신뢰구간 폭은 평균 약 ±0.6점이어서 이보다 작은 상승 효과는 실험으로 포착하기 어려움

오른쪽을 향하는 이미지 구성

  • 7개 연구소가 생성한 펠리컨-자전거 이미지 21개 전부가 오른쪽을 향함
    • 48개 조합 가운데 모든 이미지의 방향이 일치한 유일한 조합임
  • 다만 전체 1,008개 이미지의 60%가 오른쪽을 향해, 오른쪽 방향 자체가 일반적임
  • 탈것별 오른쪽 방향 비율은 scooter 83%, bicycle 81%, skateboard 60%, plane 58%, unicycle 45%, boat 35%였음
  • 동물별 오른쪽 방향 비율은 antelope와 pelican이 각각 78%, heron 77%, whale 65%, flamingo 64%, otter 45%, cat 40%, raccoon 36%였음
  • 펠리컨이나 자전거를 정면으로 그리기 어려워 모델은 대체로 좌우 측면 구도를 선택하며, 이 때문에 방향이 모호한 이미지도 적음
  • 다른 조합도 높은 방향 일치율을 보임
    • antelope-scooter와 pelican-scooter는 각각 21개 중 20개가 같은 방향임
    • heron-bicycle은 21개 중 19개가 같은 방향임
  • 48개 조합 중 하나에서 21개 이미지가 모두 같은 방향을 보인 결과만으로는 특별한 이상치라 보기 어려움

장면 요소에서 암기 흔적 찾기

  • Gemini 3.1 Flash-Lite가 이미지에서 발견한 장면 요소를 자유 형식으로 추출해 암기된 구성이 반복되는지 검사함
  • 일부 조합에서는 특정 요소가 빈번하게 되풀이됨
    • flamingo-boat 이미지에는 모두 태양이 등장함
    • otter-plane 이미지의 38%에는 스카프가 나타남
    • cat-bicycle 이미지의 38%에는 바구니가 포함됨
  • 펠리컨-자전거에서도 일부 요소의 빈도가 높았지만, 다른 동물·탈것 조합과 구별되는 특별한 반복 패턴은 찾지 못함

단일 평가 모델과 제한된 예산

  • 모든 점수는 단일 평가 모델인 GPT-5.6 Luna가 이미지 하나씩을 보고 매김
    • 평가 기준 정렬을 충분히 수행하지 않았고, 재평가 시 일관성도 확인하지 않음
    • 평가 모델이 그림을 신뢰성 있게 판단하지 못한다면 정량 결과의 가치가 낮아짐
  • 평가 모델과 참가 모델 GPT-5.6 Terra가 같은 제품군이라는 제약도 있음
    • 다만 각 연구소가 48개 조합을 모두 생성했으므로 특정 연구소의 화풍을 선호하더라도 전체 격자의 점수가 함께 상승함
    • 분석은 연구소 내부의 조합별 차이를 비교하므로 이런 선호가 핵심 결과를 바꾸지는 않음
  • 특정 프롬프트가 아니라 SVG 생성 전체 또는 ‘탈것을 탄 동물’ 같은 범주를 최적화하는 SVGmaxxing은 검출할 수 없음
    • 모든 셀의 성능이 함께 상승하므로 단순히 SVG를 잘 생성하는 모델과 구분되지 않음
    • Google/DeepMind는 이런 최적화를 공개적으로 수행
  • 전체 실험 비용은 API 크레딧 약 80달러였음
    • 셀당 3개 샘플, 평가 모델 1개, 참가 모델 7개로 제한됨
    • 프롬프트와 파이프라인을 충분히 반복 개선하지 못해 “plane”과 “airplane” 같은 문제가 남음

특정 프롬프트 최적화의 증거는 없음

  • 펠리컨은 다른 동물보다 잘 그려지지 않았고 자전거도 다른 탈것보다 우수하지 않았으며, 어떤 연구소도 개별 펠리컨·자전거 성능에서 예상되는 수준보다 해당 조합을 유의하게 잘 그리지 못함
  • GLM-5.2가 특정 펠리컨-자전거 셀에서 가장 큰 상승분을 기록했지만, 효과가 작고 통계적으로 유의하지 않음
  • 21개 이미지가 모두 오른쪽을 향한 점은 눈에 띄지만, 전체적으로 오른쪽 구도가 흔하고 다른 세 조합도 90% 이상의 일치율을 기록함
  • 특정 벤치마크만 겨냥한 pelicanmaxxing보다 SVG 생성 전반을 강화하는 SVGmaxxing이 더 가능한 형태지만, 이 실험으로 어느 연구소가 이를 수행하는지는 판별할 수 없음
Read Entire Article