Search
Duplicate

[My Agent]8. Hermes 에이전트 최적화용 로컬모델 교체 실험

목차(클릭하세요)
결론: Hermes Agent 구조 자체의 오버헤드가 너무 크기 때문 답변이 느릴 수 밖에 없음
[참고사이트]

1-1. 고민의 시작

Hermes 에이전트에서 슬랙으로 로컬모델(Gemma 4 E2B)을 호출하면 답변이 느리고 엉뚱함
더 나은 로컬모델로 교체 시도

1-2. 현재 환경 진단

에이전트: Hermes Agent (Windows 네이티브)
현재 모델: gemma4-gpu-ctx:latest (Gemma 4 E2B)
문제점 1: 엉뚱한 답변 빈번 → Gemma 4 E2B는 모바일/엣지용 모델 (2.3B 실효 파라미터), 에이전트 툴 호출에 부적합
문제점 2: 속도 느림 → 원인 파악 필요

1-3. Hermes Agent 최소 컨텍스트 요구사항

ctx(context window): 모델이 한 번에 기억할 수 있는 텍스트 양
65536 = 약 5만 토큰 분량을 메모리에 유지
Hermes Agent는 최소 64K 컨텍스트 필수 — 미달 시 대화 시작 자체가 거부됨
Hermes Agent가 최소 64K 컨텍스트를 요구하고 있음
로컬 모델 사용 시 Ollama에서 -c 65536 으로 ctx를 반드시 설정해야 함

2. 로컬 Ollama vs Hermes 에이전트 경유 속도 차이

구분
Ollama 직접
Hermes 에이전트 경유
전송 내용
질문만
질문 + 시스템 프롬프트 + 툴 정의 29개 + 스킬 목록 + 메모리
고정 오버헤드
없음
매 턴 약 14,000 토큰
속도
빠름
느림
Ollama에 직접 질문하면 모델 추론만 수행
Hermes 경유 시 매 턴마다 고정 오버헤드 14,000 토큰을 함께 전송 → 모델 성능 문제가 아닌 구조적 오버헤드

3. hermes3 교체 시도 및 결과

항목
Gemma 4 E2B
Hermes 3 8B
실효 파라미터
2.3B (임베딩 포함 5.1B)
8B
설계 목적
모바일/엣지 경량 추론
에이전트 워크플로우 특화
VRAM (Q4)
~8GB
~17GB (65k 컨텍스트 포함)
툴 호출 정확도
낮음
높음
3060 Ti 8GB 결과
100% GPU
67% CPU 오프로딩 → 1분 이상
hermes3는 모델(6.1GB) + KV캐시(65k) = 17GB 필요 → 8GB VRAM 초과
CPU 오프로딩 67% 발생 → 응답 1분 이상, Empty response 반복

4. 결론

RTX 3060 Ti 8GB에서 Hermes Agent용 로컬모델의 현실적 한계
Gemma 4 E2B: 100% GPU, 65k 컨텍스트 충족, 빠름 → 단, 답변 품질 낮음
Hermes 3 8B: 답변 품질 높음 → 단, VRAM 초과로 실사용 불가
8GB VRAM 환경에서 품질과 속도를 동시에 만족하는 로컬모델은 현재 없음
최적화 전략: 로컬은 Gemma 4 E2B 유지, 중요한 작업은 클라우드 API 사용