Ohse AI LabOHSE AI LAB
🤖 AI 연구

7월의 AI 투자 연구: 더 큰 모델이 정답이 아니다

오세에이아이연구소··23분 읽기

7월의 AI 투자 연구: 더 큰 모델이 정답이 아니다

"돈을 더 쓰면 성능이 더 좋아질까?" — 2026년 7월 연구들이 이 질문에 정면으로 답합니다.


들어가며: 편의점과 클라우드 LLM의 공통점

편의점에서 음료를 고를 때, 비싼 음료가 항상 맛있는 건 아닙니다. 500원짜리 생수가 목마름엔 가장 확실하죠. AI 투자 시스템도 비슷합니다. 2026년 7월, 전 세계 연구자들은 "더 비싼 AI 모델을 쓰면 투자 성과가 더 좋아질까?"라는 질문을 정면으로 파고들었습니다. 결론부터 말하면, 비용을 인식한 지능적인 설계가 단순히 큰 모델을 쓰는 것보다 낫다는 쪽으로 수렴하고 있습니다.

이번 달에는 LLM 에이전트의 비용 효율화, 탈중앙화 거래소의 수천만 달러 규모 비효율, 추세추종 전략의 주파수 영역 재해석, 포트폴리오 최적화에서의 분포 불확실성, 그리고 시계열 예측의 신뢰구간 보정까지 — 다섯 가지 테마로 262편의 논문 중 핵심을 정리합니다.


테마 1: LLM 에이전트 — "큰 모델을 쓰지 말고, 현명하게 쓰라"

문제: 비용이 폭발한다

요즘 금융 뉴스 감성 분석에 LLM을 쓰는 건 자연스러운 일이 되었습니다. 뉴스가 "긍정"인지 "부정"인지를 AI가 판단하고, 그 결과로 매매 신호를 만들죠. 그런데 문제가 있습니다. 대부분의 뉴스 문장은 아주 쉽습니다. "매출 증가"가 긍정인지 부정인지는 초등학생도 알죠. 그런데도 값비싼 클라우드 LLM이 모든 문장을 처리해야 하니, 사용자가 10만 명이면 비용도 10만 배로 늘어납니다.

TriAgent의 해결책: 에이전트 세 명을 계층으로 쓰자

이 문제에 대해 중국과 미국 연구팀이 제안한 TriAgent는 기발한 접근법을 씁니다. 세 가지 다른 수준의 AI 에이전트를 한 팀으로 묶은 거예요:

  • 1단계 (VADER): 단어 단위로 긍정/부정을 빠르게 판단하는 사전 기반 도구. 가장 싸고 빠릅니다.
  • 2단계 (FinBERT): 금융 문장에 특화된 중간 크기 모델. 문장 단위의 맥락을 이해합니다.
  • 3단계 (Qwen2.5): 문장 사이의 관계까지 추론하는 대형 LLM. 가장 비싸지만 가장 정확합니다.

핵심은 어떤 문장을 어떤 에이전트에게 보낼지를 자동으로 결정하는 의미적 분기 지수(SDI)라는 신호입니다. 세 에이전트의 판단이 서로 일치하면 쉬운 문장이니 1단계로 끝내고, 불일치하면 어려운 문장이니 3단계 LLM에게 보냅니다.

그림: TriAgent 시스템 구조도. 쿼리가 먼저 공유 합의 사전(SCD)을 거치고, 캐시 미스 시 세 단계 위원회가 실행된 뒤 SDI가 계산되어 라우팅을 결정합니다.

놀라운 발견: "크리틱 플레이토"

가장 인상적인 발견은 이겁니다. LLM을 다른 에이전트의 결과를 검토하는 "크리틱" 역할로 재배치했더니, 1.5B(15억 개 파라미터)짜리부터 7B(70억 개)짜리까지 성능이 거의 같았습니다. F1 점수가 약 0.87에서 멈추더라는 거예요. 같은 크기 모델 세 개가 투표하면 오히려 0.66으로 떨어졌고요.

쉬운 비유를 하면, 키가 큰 사람 세 명이 투표하는 것보다, 키가 작은 사람 세 명이 각자 다른 관점에서 검토하는 게 더 정확하다는 뜻입니다. 크기가 아니라 다양성이 정확도를 만든다는 거죠.

이 발견이 실전에 의미하는 바는 명확합니다. 10M(천만) 사용자 규모에서 TriAgent는 GPT-4o-mini 대비 연간 약 121억 원($9.3M)을 절감합니다. Sharpe 비율도 SDI 단일 단계 전략이 3.50으로, 항상 FinBERT만 쓰는 전략(1.36)이나 항상 LLM만 쓰는 전략(0.11)을 압도했습니다.

함께 읽을 논문들

  • [2607.20645] Frontier Financial Judgement: 최신 금융 에이전트도 "이 뉴스가 주가에 영향을 줄까?"라는 질문에 안정적으로 답하지 못한다는 부정적 결과. 정확도와 비용 사이의 트레이드오프를 정량화했습니다.
  • [2607.17427] Abliteration Is Not a Scalpel: LLM의 거부 반응을 제거하는 가중치 수술이 금융 의사결정의 낙관성과 확신까지 바꿔버린다는 발견. 모델을 수정할 때 생각지도 못한 부작용이 생길 수 있다는 경고입니다.
  • [2607.10286] Can Agentic Trading Systems Pay for Their Own Intelligence?: 에이전트가 벌어들인 수익에서 AI 사용 비용을 뺀 "자생적 수익성"을 평가하자는 관점 제시.

테마 2: 탈중앙화 거래소 — 보이지 않는 수천만 달러의 손실

문제: DEX에서 스왑할 때 손해를 보고 있다

이더리움에서 암호화폐를 스왑(교환)할 때, 우리는 보통 하나의 탈중앙화 거래소(DEX)에서 가장 좋은 가격을 찾아 실행합니다. 그런데 실제로는 같은 토큰 쌍에 여러 개의 유동성 풀이 있고, 이 풀들을 어떻게 조합하느냐에 따라 가격이 달라집니다. 이 "라우팅" 문제를 얼마나 잘 해결하고 있을까요?

대규모 감사 결과: 연 $2,400만의 손실

뉴욕대 연구팀이 이더리움에서 298만 건의 WETH-USDC 스왑을 전수 조사한 결과, 평균적으로 거래당 2.02 베이시스 포인트(bps)의 손실이 발생하고 있었습니다. 전체 기간으로 환산하면 약 $2,400만(약 312억 원) 규모입니다.

그림: 세 가지 최적 벤치마크 대비 실현 라우팅의 비효율 분포. 박스 플롯의 삼각형은 평균을, 박스는 25/50/75 백분위수를 나타냅니다.

연구팀은 세 가지 재현 가능한 벤치마크를 새로 만들었습니다:

  1. SCO (Support-Constrained Optimum): 실제로 사용된 풀 내에서 분할을 얼마나 잘했는지 평가
  2. FVO (Full-Venue Optimum): 모든 가용 풀을 고려했다면 얼마나 나았을지 측정
  3. G-FVO (Gas-Aware FVO): 가스 비용까지 반영한 실용적 최적

핵심 발견 두 가지

첫째, 정보의 "신선도"가 핵심입니다. 실행 시점의 블록체인 상태 대신 한 블록만 지연된 상태로 라우팅하면 성능이 눈에 띄게 떨어집니다. 같은 지연된 스냅샷에서 평가하면 실현 라우트가 최적에 훨씬 가까워지므로, 문제는 라우터 자체보다 타이밍 불일치에 있다는 뜻입니다.

둘째, 손실은 극단적으로 치우쳐 있습니다. 작은 거래는 비율로 따지면 손실이 더 크지만, 달러 기준으로는 극단적 이상치 몇 건이 전체 손실을 지배합니다. 그리고 샌드위치 공격이 이 비효율의 상당 부분을 설명합니다.

실전 시사점

DEX에서 거래하거나 유동성을 공급하는 분이라면, 라우터의 품질을 정기적으로 감사할 필요가 있습니다. 특히 가스 비용과 상태 지연을 함께 고려한 최적 주문 분할이 중요합니다. 연구팀의 벤치마크 프로토콜과 알고리즘은 모두 공개되어 있어 직접 적용할 수 있습니다.


테마 3: 추세추종 — 주파수로 읽는 200년 된 전략의 비밀

추세추종이란?

가격이 오르면 따라 사고, 내리면 따라 파는 가장 단순한 전략입니다. 200년 넘게 평균적으로 수익을 냈지만, "왜 수익이 나는지"에 대한 이론적 합의는 부족했습니다.

스펙트럼으로 읽는 알파

핀란드와 러시아 연구팀은 추세추종의 본질을 주파수 영역에서 재해석했습니다. 쉽게 말하면, 주가 움직임을 음파처럼 저주파(천천히 움직이는 부분)와 고주파(빠르게 움직이는 부분)로 나누면, 추세추종은 저주파 영역의 에너지가 충분히 클 때만 수익을 냅니다.

더 정확하게는, 변동성으로 정규화한 수익률의 스펙트럼 밀도에 특정 가중함수(푸아송 커널)를 곱한 합이 1을 초과하면 수익이 나고, 아니면 손실이 납니다. 이게 드리프트(추세)가 0이어도 성립한다는 게 핵심입니다.

그림: 백색 잡음 과정에서 유럽형 추세추종 시스템의 예상 연수익률, 총 Sharpe, 순 Sharpe를 드리프트와 필터 스팬의 함수로 보여줍니다. 거래 비용이 존재할 때 최적 스팬이 존재함을 보여줍니다.

실용적 성과: 폐형식 Sharpe와 비용 최적 스팬

이 프레임워크의 가장 큰 실용적 기여는 Sharpe 비율을 폐형식으로 계산할 수 있다는 점입니다. 자기상관 구조와 드리프트만 알면 어떤 시장에서 어떤 룩백 기간의 추세추종이 수익을 낼지 미리 예측할 수 있습니다. 거래 비용까지 넣으면 비용 최적 필터 길이도 구할 수 있습니다.

실증 검증 결과, 1997년부터 2026년 7월까지의 유동 선물 데이터에서 모든 추세추종 시스템이 강하게 상관되어 있어, 이 통합 분석의 타당성을 확인했습니다.

한 가지 더: 양의 왜도라는 선물

추세추종 수익률의 분포는 모든 시간 지평에서 양의 왜도를 보입니다. 쉽게 말하면, 큰 이익이 큰 손실보다 더 자주 발생한다는 뜻입니다. 이건 특정 모형의 산물이 아니라 추세추종의 구조적 속성입니다. 포트폴리오에 추세추종을 포함시키는 또 하나의 이유가 되죠.

함께 읽을 논문들

  • [2607.01550] Is Trend Still Your Friend?: 100개 유동 선물(19952025)에서 단기 추세추종이 2009년 이후 약화된 현상을 시장 전자화와 미시구조 변화로 설명합니다. CTA 전략 설계에 직접 필요한 실증입니다.
  • [2607.19453] Predictive Extrema, Unprofitable Policies: 높은 예측 정확도(AUC)도 거래비용을 통과하지 못하면 수익으로 전환되지 않는다는 엄격한 감사. Binance 현물 데이터 기반입니다.

테마 4: 포트폴리오 최적화 — "어떤 모형이 맞는지 모를 때" 어떻게 할까?

문제: 분포 선택 자체가 불확실하다

포트폴리오 최적화의 전통적 접근은 이렇습니다: 수익률 분포를 추정하고 → 그 분포에서 최적 포트폴리오를 찾습니다. 그런데 "어떤 분포가 맞는지" 확신할 수 없으면요? 정규분포? Student-t? 혼합분포? 선택에 따라 최적 포트폴리오가 크게 달라질 수 있습니다.

해결책: 여러 모형을 동시에 고려하자

이 문제에 대해 위구르족 이름의 단독 저자인 누에르샤티 아부두레시티는 다음과 같이 접근합니다:

  1. 6개의 서로 다른 혼합 분포 모형을 적합시킵니다.
  2. 홀드아웃 데이터로 각 모형의 예측력을 비교합니다.
  3. 통계적으로 구별 불가능한 최상위 모형들의 집합, 즉 모호성 집합을 만듭니다.
  4. 이 집합 안의 가장 불리한 모형을 기준으로 최적 포트폴리오를 찾습니다.

그림: 후보 모형들의 누적 전망 이론(CPT) 분기와 강건 하한 포락선. 검은 곡선이 점별 하한으로, 이 위에서 최적 노출을 찾습니다. 오른쪽 패널은 강건 최적점 근처를 확대한 것입니다.

핵심 발견

30개 주식 수익률에 적용한 결과, 혼합 모형은 가우시안 모형보다 홀드아웃 밀도 점수가 확연히 높았습니다. 하지만 여러 모형이 모호성 집합에 남아 있어서, "최악의 모형은 포트폴리오 최적화 단계에서 결정"되어야 합니다. 홀드아웃 점수만으로 사전에 하나를 고르면 안 된다는 뜻입니다.

쉬운 비유를 하면, 시험 점수가 95점인 학생과 93점인 학생이 있을 때, 둘 다 "우수"하다고 보고 그 안에서 최선의 전략을 세우는 게 낫지, 95점짜리만 믿고 전부를 거는 것보다 안전하다는 겁니다.

실전 시사점

수익률의 꼬리 위험과 분포 모형 선택 불확실성을 함께 반영한 포지션 최적화 프로토타입으로 바로 확장할 수 있습니다. 특히 "이 모형이 맞다"고 확신하기 어려운 시장 환경에서 유용합니다.


테마 5: 시계열 예측 — 신뢰구간이 점추정보다 중요하다

문제: 금융 시계열은 독립이 아니다

주가 수익률, 변동성, 수요 데이터 같은 시계열은 시간 순서에 따라 서로 연결되어 있습니다. 그런데 대부분의 통계 도구는 데이터 포인트들이 서로 독립이라고 가정합니다. 부트스트랩이나 컨포멀 예측 같은 불확실성 정량화 도구도 마찬가지입니다.

tsbootstrap: 의존성을 보존한 실용적 도구

인도 출신 연구자 산칼프 길다가 만든 tsbootstrap 라이브러리는 이 문제를 하나의 패키지로 해결합니다:

  • 블록 부트스트랩: 인접한 데이터 블록을 통째로 리샘플링해 시간 의존성을 보존
  • 시브 부트스트랩: 자기회귀 구조를 추정한 뒤 잔차를 리샘플링
  • 와일드 부트스트랩: 잔차에 랜덤 부호를 곱하는 방식
  • EnBPI, ACI 등 컨포멀 보정기: 예측 구간을 실시간으로 조정

핵심 결과는 명확합니다. IID 부트스트랩은 시계열 의존성 하에서 커버리지를 심각하게 이탈하지만, 의존성 인식 방법은 이를 크게 개선합니다. 특히 시브 부트스트랩이 단기 기억 선형 의존성에서 표본 커버리지에 가장 가까운 성능을 보였습니다.

실전 시사점

수익률이나 변동성 예측 모델의 예측구간을 설정할 때, IID 가정 대신 이 라이브러리를 쓰면 포지션 사이징과 리스크 한도가 훨씬 정확해집니다. MIT 라이선스로 공개되어 있고, arch 라이브러리보다 수 배 빠른 컴파일된 백엔드를 포함합니다. 스트리밍 환경에서도 메모리 효율적입니다.

함께 읽을 논문들

  • [2607.05291] Forecasting Realized Volatility with TSFMs: 시계열 파운데이션 모형이 HAR 계열을 포함한 전통적 변동성 예측모형을 50개 자산에서 실제로 능가하는지를 체계적으로 검증한 연구입니다.
  • [2607.08500] Estimating the SDF from Option Prices: 옵션 가격에서 추출한 비단조적 확률할인인자(SDF)로 주식 프리미엄을 예측하는 새로운 프레임워크.

7월의 Big Picture: "비용을 인식한 지능"

이번 달 연구들을 관통하는 하나의 메시지가 있습니다. "정확한 점추정보다, 비용을 인식한 강건한 의사결정이 실전 가치가 높다"는 것입니다.

  • TriAgent는 "더 큰 모델" 대신 "현명한 라우팅"으로 연 121억 원을 절약했습니다.
  • DEX 라우팅 연구는 "최적 실행"의 장애물이 알고리즘이 아니라 상태 정보의 적시성임을 보여줬습니다.
  • 추세추종 연구는 거래 비용까지 포함한 폐형식 최적 룩백을 제공했습니다.
  • 포트폴리오 연구는 모형 선택 자체의 불확실성을 최적화에 직접 통합했습니다.
  • 시계열 도구는 IID 가정을 버린 실용적 신뢰구간을 제공했습니다.

투자 시스템을 만드는 분들에게 이 발견들이 의미하는 바는 분명합니다. AI 모델의 크기를 키우기 전에, 먼저 비용 구조와 불확실성 관리를 정교화하세요. 더 크기보다 더 현명하게.


함께하기

이 글이 유익하셨다면 아래 채널에서 더 많은 연구 소식을 받아보세요.

  • 🌐 ohselab.com
  • 📧 뉴스레터 구독
  • 💬 상담 문의

더 알아보기

논문arXiv5차원 점수
TriAgent: Divergence-Aware Multi-Agent Committees2607.19794N79/A78/R72/Rp82/I80
Quantifying Sub-Optimality in DEX Routing2607.20762N74/A82/R79/Rp63/I81
The Science and Practice of Trend-Following2607.19497N74/A86/R82/Rp42/I84
Mixing-Law Uncertainty in NMVM2607.18813N71/A76/R78/Rp43/I74
tsbootstrap: UQ for Time Series2607.06690N64/A76/R67/Rp78/I68

이 글은 ohselab KB의 현재 등급(2026-08-01 기준)을 기준으로 작성되었습니다.

AI 기술이 궁금하신가요?

오세에이아이연구소의 AI 연구와 제품에 대해 문의해주세요.

문의하기

관련 글

FinRL-Meta의 데이터 레이어 구조 — 주식, ETF, 선물 등 다양한 자산군의 데이터를 자동으로 수집하고 처리하는 파이프라인
🤖 AI 연구

2022년 11월의 AI 투자 연구: 데이터 표현이 모델보다 중요하다

2022년 11월 시스템 트레이딩 연구 동향. 금융 RL 벤치마크 인프라(FinRL-Meta), 주문장 데이터 표현의 결정적 영향, 기대수익 없이 포트폴리오를 짜는 리스크 버짓팅, 비마코비안 최적 청산의 해석적 해.

20
시스템트레이딩FinRL-Meta+7
AI가 포트폴리오를 짜고, 뉴스를 조작하고, 블록체인에서 대량 매도한다 — 2026년 1월 금융 AI 연구 하이라이트
🤖 AI 연구

AI가 포트폴리오를 짜고, 뉴스를 조작하고, 블록체인에서 대량 매도한다 — 2026년 1월 금융 AI 연구 하이라이트

2026년 1월 arXiv에 올라온 금융 AI 연구를 5개 테마로 정리했습니다. 파라미터 불확실성을 포트폴리오에 반영하는 방법, LLM 에이전트의 결정 재현성 문제, DEX에서의 대량 매도 최적화, 연합학습으로 신용리스크를 예측하는 방법, 그리고 주문흐름과 변동성을 하나로 묶는 미시구조 이론까지.

22
금융AI포트폴리오최적화+6
AI 금융 에이전트, 정말 똑똑할까? — 투자 리서치의 진짜 능력을 측정하는 벤치마크의 등장
🤖 AI 연구

AI 금융 에이전트, 정말 똑똑할까? — 투자 리서치의 진짜 능력을 측정하는 벤치마크의 등장

금융 데이터 추출을 넘어 실제 투자자 워크플로 전체를 평가하는 FrontierFinance 벤치마크를 소개합니다. 220개 전문가 설계 쿼리와 11,543개 이진 루브릭으로 금융 AI 에이전트의 진짜 능력을 측정한 결과, 최고 시스템도 56% 수준임을 보여줍니다.

20
금융AI에이전트+7