Version 간 결과 비교/분석

Aug 20, 2026·
In Hyuk
In Hyuk
· 2 min read
blog

LangGraph를 사용하기 이전(전부 4o모델) vs 모델 분기 비교 실험

결과

MetricBaselineRouting V2Change (%)
Runs85.000085.00000.0000
Total Cost ($)0.85200.7277-14.5903
Avg Cost ($)0.01000.0086-14.5903
Mean Latency (s)4.64337.5294+62.1563
P50 Latency (s)4.25947.3486+72.5282
P95 Latency (s)7.23149.9255+37.2561
P99 Latency (s)9.406313.0560+38.8006

LLM-based routing은 비용을 감소시켰지만 sequential LLM calls로 P95 latency가 너무 증가하는 문제점이 생겼다. Total Cost와 Latency의 문제를 둘 다 잡는 다른 방법에 대한 고민이 필요해보였다..

LLM Router 까지 두어서 LLM 모델을 두 번 처리하는 게 문제였기에, LLM Router를 제거하고 lightweight intent classifier로 대체 하려고 함.

  • 기존 LLM Router 대신 sentenceTransformer + LogisticRegression 기반 classifier로 구현하고자 함.

v1 vs v2 vs v3

MetricV1 BaselineV2 LLM RouterV3 Classifier
Runs858585
Total Cost ($)0.85570.74010.7224
Avg Cost / Run ($)0.01010.00870.0085
Mean Latency (s)4.13866.21943.3433
P50 Latency (s)3.11195.40873.1164
P95 Latency (s)7.414911.03797.0132
P99 Latency (s)12.938711.92338.7200
API Calls858567
API Call Rate (%)100.00100.0078.82
Extract Rule Correctness0.89410.90480.9024
Extract Rule Correctness (if routed)-0.90480.8780
Route Correctness-1.00000.9756
  • V3는 V1 대비 비용 15.58%, 평균 Latency 19.22% 감소했고, LLM API 호출도 21.18% 절감함.
  • 정확도는 V1 0.8941 → V3 0.9024로 유지·소폭 개선되어, 성능 저하 없이 비용과 응답 속도를 함께 개선함.
In Hyuk
Authors
Data Analyst
데이터AI를 통해 가치를 만드는 것을 좋아합니다.
LLM을 활용한 서비스로 가치를 창출하고 유저 데이터 분석에 관심이 있습니다.