더 값싼 LLM으로 바꾸고 싶은데, 유저가 이탈할까봐 못 바꾸고 있나요? 안녕하세요! 이 문제를 해결하기 위해 ABTO를 만들고 있습니다. 흔히 AI 기능에 쓸 모델을 고를 때 벤치마크 보고, 프롬프트 계속 돌려보고, 답변을 비교해가며 선택합니다. 그런데 그렇게 고른 모델이 실제 서비스에서도 좋은 선택인지는 별도로 확인해야만 하죠. 비싼 모델을 쓴다고, 답변이 더 길고 자세하다고 유저가 더 오래 서비스를 사용하거나 결제를 더 많이 하는 건 아닐 수 있으니까요. 저희는 여기서 큰 불편함을 발견했습니다. 기존 Langfuse, Mixpanel 같은 도구들은 단편적으로 유저 지표를 보거나, LLM 지표는 볼 수 있어도 이 둘을 묶어서 하나의 흐름으로 보면서 테스팅 해볼 수가 없었거든요. 결국 서비스 운영자 입장에서 확인하고 싶은 것은 Claude를 쓸 때 비용 당 매출을 일으키는 유저 액션이 얼마인지, Gemini를 쓸 때 비용 당 매출을 일으키는 유저 액션이 얼마인지 이런 것을 알아보고 개선시키고 싶은데 말이죠. ABTO는 실제 서비스의 트래픽을 모델별로 나눠서 호출 비용과 이후 유저 행동을 함께 비교하는 LLM A/B 테스트 도구입니다. LLM Router + Posthog(or GA, Mixpanel) 라고 생각해주시면 이해가 편하실 거 같습니다. 예를 들어 AI 글쓰기 서비스라면 다음처럼 사용할 수 있습니다. 초안 생성 기능에 모델 A와 B를 연결합니다. 각 모델로 보낼 트래픽 비율을 정합니다. (ex. 10% vs 90%, 50% vs 50% 등) 유저가 생성한 초안과, 저장하거나 공유한 초안, 결제 등을 각각 이벤트로 연결합니다. 보고 싶은 성과 지표를 설정합니다. 각 모델 별 유저가 생성한 초안 대비 저장하거나 공유한 초안 비율 각 모델 별 결제 비율 각 모델 별 성과 지표를 비교하고, 결과를 보고 어느 모델이 비용 대비 효과가 좋은지 판단하고, 트래픽 비율을 조정해볼 수 있습니다. 이렇게 “어느 모델의 답변이 더 좋아 보이는가”에서 한 걸음 더 나아가, "우리 서비스 유저가 어느 모델의 결과를 실제로 자주 사용하는가"를 ABTO에서 확인할 수 있습니다. 초안 생성과 첨삭처럼 기능을 나눠 각 기능별로 비교할 수도 있습니다. 최대한 속도와 안정성을 보장하기 위해 다음과 같이 구현했어요. Gateway는 Go 기반이며 Goroutine으로 최대한 동시성을 챙겼어요. SDK, Gateway에서 여러 단계의 f...
Show GN: ABTO : 실제 유저의 전환율과 비용으로 비교하는 LLM 모델 A/B 테스트
3 weeks ago
21
Related
D2Coding 폰트 1.4.0 릴리즈 소식을 전합니다.
1 hour ago
2
FE News 26년 10월 소식을 전해드립니다.
1 hour ago
3
자율주행 데이터에서 시간은 어떻게 맞춰지는가
1 hour ago
2
2026년 개발자 현황
1 hour ago
3
Strands Decider 2B - 소형 오픈소스 의사결정 모델
2 hours ago
3
Tell HN: GitHub이 한 달이 지나도 제 소프트웨어의 크랙 복제본 삭제를 거부합니다
2 hours ago
3
Penguin Mail - AI를 탑재한 Linux용 오픈소스 Rust 이메일 클라이언트
3 hours ago
3
Show GN: 이메일 피싱 모의훈련을 전화로 옮겼습니다. 예고 없는 전화
4 hours ago
3
Tips
click
Popular
프로들도 줄지어 샷 점검… KLPGA 스타 사랑방 된 더헤븐CC 연습장
2 weeks ago
73
iOS 27, iPadOS 27, macOS 27
3 weeks ago
69
손흥민 선제골 발판·골대 불운…LAFC, 7경기 만에 승리
3 weeks ago
65
영림원소프트랩, 나람 통합 ERP 구축…사료 제조·물류·회계 데이터 하나로
2 weeks ago
62
'이 악문' 김영범, 자유형 50m '대회 신기록' 금메달
2 weeks ago
55
© Clint IT 2026. All rights are reserved









English (US) ·