목차(클릭하세요)
결론: Hermes Agent 구조 자체의 오버헤드가 너무 크기 때문 답변이 느릴 수 밖에 없음
[참고사이트]
1-1. 고민의 시작
•
Hermes 에이전트에서 슬랙으로 로컬모델(Gemma 4 E2B)을 호출하면 답변이 느리고 엉뚱함
•
더 나은 로컬모델로 교체 시도
1-2. 현재 환경 진단
•
에이전트: Hermes Agent (Windows 네이티브)
•
현재 모델: gemma4-gpu-ctx:latest (Gemma 4 E2B)
•
문제점 1: 엉뚱한 답변 빈번 → Gemma 4 E2B는 모바일/엣지용 모델 (2.3B 실효 파라미터), 에이전트 툴 호출에 부적합
•
문제점 2: 속도 느림 → 원인 파악 필요
1-3. Hermes Agent 최소 컨텍스트 요구사항
•
ctx(context window): 모델이 한 번에 기억할 수 있는 텍스트 양
•
65536 = 약 5만 토큰 분량을 메모리에 유지
•
Hermes Agent는 최소 64K 컨텍스트 필수 — 미달 시 대화 시작 자체가 거부됨
◦
Hermes Agent가 최소 64K 컨텍스트를 요구하고 있음
2. 로컬 Ollama vs Hermes 에이전트 경유 속도 차이
구분 | Ollama 직접 | Hermes 에이전트 경유 |
전송 내용 | 질문만 | 질문 + 시스템 프롬프트 + 툴 정의 29개 + 스킬 목록 + 메모리 |
고정 오버헤드 | 없음 | 매 턴 약 14,000 토큰 |
속도 | 빠름 | 느림 |
•
Ollama에 직접 질문하면 모델 추론만 수행
•
Hermes 경유 시 매 턴마다 고정 오버헤드 14,000 토큰을 함께 전송 → 모델 성능 문제가 아닌 구조적 오버헤드
3. hermes3 교체 시도 및 결과
항목 | Gemma 4 E2B | Hermes 3 8B |
실효 파라미터 | 2.3B (임베딩 포함 5.1B) | 8B |
설계 목적 | 모바일/엣지 경량 추론 | 에이전트 워크플로우 특화 |
VRAM (Q4) | ~8GB | ~17GB (65k 컨텍스트 포함) |
툴 호출 정확도 | 낮음 | 높음 |
3060 Ti 8GB 결과 |
•
hermes3는 모델(6.1GB) + KV캐시(65k) = 17GB 필요 → 8GB VRAM 초과
•
CPU 오프로딩 67% 발생 → 응답 1분 이상, Empty response 반복
4. 결론
•
Gemma 4 E2B: 100% GPU, 65k 컨텍스트 충족, 빠름 → 단, 답변 품질 낮음
•
Hermes 3 8B: 답변 품질 높음 → 단, VRAM 초과로 실사용 불가
•
8GB VRAM 환경에서 품질과 속도를 동시에 만족하는 로컬모델은 현재 없음
•
최적화 전략: 로컬은 Gemma 4 E2B 유지, 중요한 작업은 클라우드 API 사용




