Search
Duplicate
moon
sun

[My Agent]8. Hermes 에이전트 최적화용 로컬모델 교체 실험

목차(클릭하세요)
💡
결론: Hermes Agent 구조 자체의 오버헤드가 너무 크기 때문 답변이 느릴 수 밖에 없음
[참고사이트]

1-1. 고민의 시작

•
Hermes 에이전트에서 슬랙으로 로컬모델(Gemma 4 E2B)을 호출하면 답변이 느리고 엉뚱함
•
더 나은 로컬모델로 교체 시도

1-2. 현재 환경 진단

•
에이전트: Hermes Agent (Windows 네이티브)
•
현재 모델: gemma4-gpu-ctx:latest (Gemma 4 E2B)
•
문제점 1: 엉뚱한 답변 빈번 → Gemma 4 E2B는 모바일/엣지용 모델 (2.3B 실효 파라미터), 에이전트 툴 호출에 부적합
•
문제점 2: 속도 느림 → 원인 파악 필요

1-3. Hermes Agent 최소 컨텍스트 요구사항

•
ctx(context window): 모델이 한 번에 기억할 수 있는 텍스트 양
•
65536 = 약 5만 토큰 분량을 메모리에 유지
•
Hermes Agent는 최소 64K 컨텍스트 필수 — 미달 시 대화 시작 자체가 거부됨
◦
Hermes Agent가 최소 64K 컨텍스트를 요구하고 있음
💡 로컬 모델 사용 시 Ollama에서 -c 65536 으로 ctx를 반드시 설정해야 함

2. 로컬 Ollama vs Hermes 에이전트 경유 속도 차이

구분
Ollama 직접
Hermes 에이전트 경유
전송 내용
질문만
질문 + 시스템 프롬프트 + 툴 정의 29개 + 스킬 목록 + 메모리
고정 오버헤드
없음
매 턴 약 14,000 토큰
속도
빠름
느림
•
Ollama에 직접 질문하면 모델 추론만 수행
•
Hermes 경유 시 매 턴마다 고정 오버헤드 14,000 토큰을 함께 전송 → 모델 성능 문제가 아닌 구조적 오버헤드

3. hermes3 교체 시도 및 결과

항목
Gemma 4 E2B
Hermes 3 8B
실효 파라미터
2.3B (임베딩 포함 5.1B)
8B
설계 목적
모바일/엣지 경량 추론
에이전트 워크플로우 특화
VRAM (Q4)
~8GB
~17GB (65k 컨텍스트 포함)
툴 호출 정확도
낮음
높음
3060 Ti 8GB 결과
✅ 100% GPU
❌ 67% CPU 오프로딩 → 1분 이상
•
hermes3는 모델(6.1GB) + KV캐시(65k) = 17GB 필요 → 8GB VRAM 초과
•
CPU 오프로딩 67% 발생 → 응답 1분 이상, Empty response 반복

4. 결론

⚠️ RTX 3060 Ti 8GB에서 Hermes Agent용 로컬모델의 현실적 한계
•
Gemma 4 E2B: 100% GPU, 65k 컨텍스트 충족, 빠름 → 단, 답변 품질 낮음
•
Hermes 3 8B: 답변 품질 높음 → 단, VRAM 초과로 실사용 불가
•
8GB VRAM 환경에서 품질과 속도를 동시에 만족하는 로컬모델은 현재 없음
•
최적화 전략: 로컬은 Gemma 4 E2B 유지, 중요한 작업은 클라우드 API 사용