Đào tạo doanh nghiệpHermes Agent Bot Mode: Xây Dựng & Điều Hành Đội Ngũ Nhân Sự AI Đa Nhiệm (Building Your AI Team)
3/8

Giáo trình tự học miễn phí · Dịch vụ hỗ trợ theo nhu cầu.

Bài 0335phút ước tínhCơ bản

3. Chiến Lược Phân Bổ Mô Hình 'Đúng Việc - Đúng Não' (Model Routing)

Tối ưu hóa bài toán ngân sách API khi vận hành nhiều Agent: Gán model suy luận cao cho Bot chiến lược, gán model giá rẻ cho Bot thực thi, cấu hình fallback model khi quá tải.

Nếu bạn cho cả 5 Bot trong đội ngũ cùng dùng OpenAI o1 hoặc Claude 3.7 Sonnet với extended thinking, chi phí API sẽ đốt cháy ngân sách trong vài ngày. Bậc thầy vận hành AI luôn áp dụng chiến lược 'Đúng việc - Đúng não': Trả tiền cao cho tư duy chiến lược, dùng model siêu tiết kiệm cho tác vụ lặp lại.

🧠 Ma Trận Phân Bổ Model Theo Vai Trò Trong Đội Ngũ

| Vị trí Bot | Tính chất công việc | Model khuyến nghị | Lý do kinh tế |

| :--- | :--- | :--- | :--- |

| Boss Bot (Điều phối) | Lập kế hoạch, phân rã task, kiểm định chất lượng | Claude 3.7 Sonnet / OpenAI o3-mini | Cần suy luận logic đa bước, khả năng ra quyết định chính xác |

| Researcher Bot | Cào dữ liệu, tổng hợp bài viết, tìm kiếm thông tin | DeepSeek R1 / Perplexity Sonar | Khả năng trích xuất dữ liệu mạnh mẽ với chi phí rất mềm |

| Writer / Formatter Bot | Viết email, soạn bài post, định dạng Markdown | Claude 3.5 Haiku / DeepSeek V3 / Llama 3.3 | Tốc độ cực nhanh (100+ tokens/s), chi phí chỉ bằng 1/15 model đầu bảng |

| Local Assistant Bot | Quét dữ liệu nội bộ máy tính, phân loại tệp | Ollama (Qwen 2.5 7B / Phi-4) | 0 đồng chi phí API, bảo mật dữ liệu tuyệt đối 100% |

example.py
# CẤU HÌNH CONFIG.YAML PHÂN PHÁT MODEL RIÊNG BIỆT CHO TỪNG PROFILE:

# 1. Profile: ~/.hermes/profiles/coordinator/config.yaml
model:
  provider: "anthropic"
  name: "claude-3-7-sonnet-20250219"
  temperature: 0.2
  max_tokens: 4000
  thinking:
    enabled: true
    budget_tokens: 2048

# 2. Profile: ~/.hermes/profiles/writer/config.yaml
model:
  provider: "anthropic"
  name: "claude-3-5-haiku-20241022"
  temperature: 0.7
  max_tokens: 2000

# 3. Profile: ~/.hermes/profiles/local-scanner/config.yaml
model:
  provider: "ollama"
  name: "qwen2.5:7b"
  base_url: "http://localhost:11434/v1"

💡 3 Kỹ Thuật Giảm Thêm 50% Chi Phí API

  1. Prompt Caching (Lưu bộ đệm): Hermes hỗ trợ Anthropic Prompt Caching. Đặt SOUL.md và tài liệu hướng dẫn cố định vào khối cache để được giảm 90% chi phí đọc lại.
  2. Deterministic Pre-filtering: Không dùng LLM để đếm số dòng hoặc tìm từ khóa trong 10.000 file. Hãy viết 1 script bash/python nhỏ để lọc ra 5 file liên quan nhất rồi mới chuyển cho LLM đọc.
  3. Cấu hình Fallback Model: Khi Anthropic hoặc OpenAI báo lỗi Rate Limit (429), Hermes tự động chuyển tiếp request sang OpenRouter hoặc DeepSeek mà không làm đứt gãy quy trình tự động.
Thực hành

Thực hành và tự đánh giá

Tính toán chi phí vận hành 1 tháng cho một đội ngũ gồm 1 Coordinator (50.000 tokens/ngày) và 2 Assistant (200.000 tokens/ngày) khi áp dụng chiến lược phân bổ model trên.

🏢 BẠN MUỐN TRIỂN KHAI CHO CẢ PHÒNG BAN / DOANH NGHIỆP?
Đề Xuất Công Ty Tài Trợ & Đào Tạo In-House Trọn Gói

AI Tinh Gọn hỗ trợ khảo sát hiện trạng, kèm 1-1 on-premise bảo mật dữ liệu, setup hạ tầng riêng và xuất hóa đơn VAT hợp pháp cho doanh nghiệp.

⚖️ Bản quyền sở hữu trí tuệ: © 2026 AI Tinh Gọn (aitinhgon.vn) · Giấy phép Creative Commons CC BY-NC-ND 4.0. Cho phép tự học cá nhân, nghiêm cấm thương mại hóa hoặc bán lại. Giáo trình mở →

Tiến độ tự học lưu trên trình duyệt này. Chỉ đánh dấu khi đã kiểm tra sản phẩm thực hành.