← 모든 글

오픈 웨이트도 기업화한다 — 작은 팀의 AI 비용 셈법

Nous Research가 $1.5B 밸류에이션을 확정하고 기업용 에이전트를 출시했다. 오픈소스처럼 보이던 AI가 상업화 수순을 밟는 지금, 소규모 팀이 AI 인프라 비용을 어떻게 설계해야 하는지 실전 수치로 뜯어본다.

지금 싼 것이 영원히 싸지는 않다

Nous Research가 시리즈 B 9천만 달러, 기업 가치 15억 달러를 확정했다. 더 중요한 건 이번에 같이 발표한 기업용 AI 에이전트 서비스다. Hermes 시리즈 — 허깅페이스에서 무료로 내려받던, LLaMA 기반 오픈 웨이트 파인튜닝 모델 — 를 만든 팀이 유료 B2B 제품을 출시한다.

작은 팀에 시사하는 핵심은 이것이다. 지금 무료 혹은 저렴하게 쓰고 있는 AI 인프라 레이어가, 공급자들의 기업화 수순에 따라 청구서를 받는 날이 온다. 모델 계층 분리와 호출 구조 설계를 지금 해두는 팀과 "나중에 보자" 하는 팀의 차이가 그때 벌어진다.

단, 이 글을 읽고 "그럼 오픈 웨이트로 당장 이전하자"고 결론 내리면 틀렸다. GPU 운영 비용이 토큰 API보다 싸 보이는 건 특정 사용량 이상일 때만이다. 그 분기점 계산을 먼저 해야 한다.

Hermes가 오픈이었던 이유와, 이제 기업화하는 이유

Nous Research는 특이한 팀이었다. 자체 베이스 모델 없이, LLaMA·Mistral 같은 공개 모델을 고품질 데이터로 파인튜닝해서 무료로 배포했다. Hermes 3 (70B) 벤치마크는 GPT-4 급 지시 따르기 성능을 보이는 테스트도 있었다. 커뮤니티 기여로 데이터를 모으고, 명성을 쌓고, 그걸 기반으로 기업 계약을 따는 구조였다.

이제 그 명성 위에 기업용 에이전트 제품을 얹은 것이다. Mistral, Together.ai, Groq도 같은 궤적을 밟았다. 오픈 웨이트 생태계가 상업화되는 건 나쁜 일이 아니다. 다만 "공짜 허깅페이스 모델이 영원히 공짜"라는 전제 위에 인프라를 설계하면 곤란하다는 뜻이다.

토큰 API vs 오픈 웨이트 — 숫자로 따져보면

Claude Haiku 기준으로 블로그 본문 한 편을 생성하는 비용을 재봤다. 프롬프트 2,000토큰 + 출력 2,000토큰이라고 하면, 입력 $0.0005 + 출력 $0.0025 = 글 한 편당 약 $0.003. 하루 20편이면 $0.06, 한 달이 $1.8이다.

Sonnet으로 검수를 한 번 더 태우면 숫자가 뛴다. Sonnet은 입력 $0.003/1K, 출력 $0.015/1K 수준이라 검수 1회에 약 $0.03 — 하루 20편이면 일 $0.60, 월 $18. 12개 봇이 각자 하루 15편씩 돌리고 전부 Sonnet 검수를 태우면, 토큰 비용만 월 $300을 훌쩍 넘는다.

그럼 오픈 웨이트로 넘어가면 될까. Hermes 3 70B를 제대로 돌리려면 A100 40GB 한 장이 최소다. AWS g5.12xlarge 온디맨드 기준 시간당 $5.67 — 한 달 상시 구동이면 월 $4,082. 8B 버전으로 타협하면 RunPod에서 RTX 4090을 시간당 $0.74에 빌릴 수 있다. 한 달 상시면 $532. 여기에 관리·장애 대응 오버헤드를 더하면 실제 총비용은 더 오른다.

결국 상시 구동이 아닌 burst 처리 용도라면 오픈 웨이트도 의미가 있다. 하루 56시간만 돌리는 배치 파이프라인이라면 월 $100150 선에서 소화 가능하다. 그게 아니라면 지금 스케일에선 Haiku가 더 싸다.

에이전트 루프가 비용을 기하급수적으로 먹는 이유

Nous Research가 이번에 강조한 것이 바로 "에이전트"다. 단일 LLM 호출이 아니라, 도구 호출·계획·피드백 루프가 반복되는 구조. 여기서 비용 폭탄이 숨어있다.

에이전트 루프 1회에 LLM을 다섯 번 호출하는 구조가 있다면, 하루 100건 처리 시 500회 호출이다. 각 호출마다 컨텍스트가 누적되면 토큰 수도 선형이 아니라 기하급수로 늘어난다. 처음엔 "에이전트 하나 달면 자동화되겠다"고 가볍게 봤는데, 실제로 돌려보면 단순 생성보다 4~8배 비용이 나오는 경우가 흔하다.

Nous Research가 $1.5B 밸류에이션을 받은 것 자체가, 이 에이전트 루프 워크로드에서 돈이 된다는 시장의 확인이다. 그 워크로드를 API 종량제로 처리할 때 비용이 얼마나 나오는지를 미리 설계해두지 않은 팀은, 쓰면서 청구서를 보고 당황하게 된다.

HEDVION 팀이라면 지금 어떻게 설계하는가

우리 구조 — 12개 봇, 일 수백 건 LLM 호출, Haiku 본문 생성 + Sonnet 검수 — 에서 비용 최적화 방향을 두 레이어로 나눠서 생각한다.

첫 레이어는 모델 계층 분리다. 지금도 그렇게 하고 있는데, bulk 생성은 Haiku, 판단이 필요한 검수·분류는 Sonnet 이상. 이게 섞이면 비용이 3~5배 벌어진다. 모든 호출을 Sonnet으로 통일하는 팀을 볼 때마다 등이 서늘해지는 건, 그 팀이 나쁜 팀이라서가 아니라 비용 가시성이 없는 구조이기 때문이다.

두 번째 레이어는 LLM 앞단의 규칙 기반 필터다. 동일 패턴이 반복되는 분류 작업 — "이 크롤 결과가 발행 가치가 있는가" 같은 판단 — 을 LLM에 매번 묻는 대신, 키워드·길이·도메인 기반 사전 필터를 달면 호출량이 30~50% 줄어든다. 신촌 AI 코딩 국비지원학원처럼 MLOps 커리큘럼을 가르치는 교육 현장에서도 최근 이 "호출 최소화 설계"가 별도 단원으로 들어간다고 들었다. 그만큼 현장 비용 문제가 됐다는 뜻이다.

세 번째는 공급자 추상화 레이어다. 우리의 claude_cli 헬퍼처럼 LLM 호출을 단일 함수로 감싸두면, 나중에 공급자를 바꾸거나 오픈 웨이트로 일부 태스크를 넘길 때 수정 범위가 함수 하나로 끝난다. 지금 직접 SDK 호출이 코드 전체에 흩어져 있으면, 마이그레이션 비용이 엔지니어링 비용이 아니라 마비 비용이 된다.

바로 써먹을 수 있는 시사점

비용 감사를 먼저 돌려라. LLM 호출 로그에서 모델별·호출처별 토큰 수를 집계하라. 대개 20%의 호출이 80%의 비용을 만들고 있다. 그 20%가 정말 비싼 모델이 필요한 작업인지를 따지는 게 첫 번째 행동이다.

에이전트 설계 시 호출 횟수를 명시적으로 캡처하라. 루프 1회당 호출 수, 평균 컨텍스트 토큰 수를 로그에 남겨라. 이걸 모르면 비용 예측이 불가능하다.

오픈 웨이트 하이브리드 경로는 지금 실험해둬라. 전환이 아니라 실험이다. Ollama + Hermes 8B를 서버 하나에 올리고 단순 분류 작업 몇 가지를 넘겨봐라. RunPod 스팟 A10G는 시간당 $0.2~$0.4이고, 상시가 아닌 야간 배치 처리라면 월 $50 이하도 가능하다. 이 경험이 없으면 "오픈 웨이트가 더 싸다"는 주장을 검증할 기준이 없다.

공급자 락인 상태를 점검하라. 지금 쓰는 API 공급자가 요금제를 올리거나, 소규모 사용자 기능을 제한한다면 대체재로 넘어가는 데 얼마나 걸리는가. 그 답을 모른다면, 지금 락인 리스크를 감수하고 있는 것이다.


원문: AI News & Artificial Intelligence | TechCrunch

* 위 링크는 인프런 affiliate 활동의 일환이며, 일정액의 수수료를 제공받을 수 있습니다.

📚 추천 강의
한 입 크기로 잘라먹는 바이브코딩 (with Claude Code)
Claude Code로 바이브코딩, 개발자라면 꼭 들어야 할 필수 강의
강의 보러가기 →

* 위 추천 링크는 쿠팡파트너스 활동의 일환이며, 일정액의 수수료를 제공받을 수 있습니다.