Đào tạo doanh nghiệpHermes Agent — Nền tảng & Cài đặt
6/6

Giáo trình tự học miễn phí · Dịch vụ hỗ trợ theo nhu cầu.

Bài 0625phút ước tínhCơ bản

6. Tự Host Local LLM Miễn Phí Với llama.cpp: Tiết Kiệm 100% Chi Phí API & Bảo Mật Tuyệt Đối

Chạy mô hình ngôn ngữ lớn cục bộ: Cài đặt inference engine llama.cpp, nạp model GGUF (Qwen 2.5 / Llama 3) và kết nối vào Hermes Agent.

Nếu doanh nghiệp của bạn có các dữ liệu tài chính hoặc thông tin nội bộ không được phép gửi ra ngoài Internet, tự host mô hình AI với llama.cpp là giải pháp bảo mật tối cao.

⚡ Ưu Thế Của Định Dạng Mô Hình GGUF

  • Tối ưu hóa phần cứng (Quantization): Nén mô hình từ float16 xuống 4-bit (Q4_K_M) giúp giảm 70% dung lượng RAM mà vẫn giữ nguyên 98% độ thông minh.
  • Chạy mượt trên CPU & GPU: Không bắt buộc phải có card đồ họa đắt tiền, CPU máy tính thông thường vẫn có thể suy luận với tốc độ 15-25 tokens/giây.
example.py
# CÀI ĐẶT VÀ KHỞI CHẠY LLAMA.CPP SERVER
# 1. Tải bản build nhị phân của llama-server
curl -L -O https://github.com/ggerganov/llama.cpp/releases/latest/download/llama-b3500-bin-ubuntu-x64.zip
unzip llama-b3500-bin-ubuntu-x64.zip -d llama_bin

# 2. Tải model Qwen 2.5 7B Instruct GGUF
wget https://huggingface.co/Qwen/Qwen2.5-7B-Instruct-GGUF/resolve/main/qwen2.5-7b-instruct-q4_k_m.gguf

# 3. Khởi chạy Server chuẩn OpenAI API trên cổng 8080
./llama_bin/llama-server \
  -m qwen2.5-7b-instruct-q4_k_m.gguf \
  --host 0.0.0.0 --port 8080 \
  -c 8192 -ngl 99
Thực hành

Thực hành và tự đánh giá

Khởi chạy llama-server trên máy tính hoặc VPS, cấu hình kết nối Endpoint http://localhost:8080/v1 vào Hermes Agent và kiểm tra tốc độ phản hồi.

Cảnh báo & Bắt bệnh

⚠️ Cạm bẫy & Bắt bệnh khi cài đặt Hermes Agent:

  1. Lỗi không kết nối được PostgreSQL: Container hermes_core khởi động trước khi postgres sẵn sàng gây lỗi kết nối CSDL.
  • Cách khắc phục: Thêm depends_on: db: condition: service_healthy vào file docker-compose.yml.
  1. Lỗi tràn chi phí API do chọn sai Model: Gán Claude 3.5 Sonnet làm Worker cho các tác vụ cào dữ liệu lặp đi lặp lại.
  • Cách khắc phục: Cấu hình phân tầng — dùng Curator Model (Sonnet/GPT-4o) lập kế hoạch và Worker Model (Haiku/Mini) thực thi.
Checklist nghiệm thu

📋 Checklist nghiệm thu Cụm Hermes Nền tảng:

  • [ ] Triển khai hoàn chỉnh Web Dashboard và Database PostgreSQL chỉ với 1 lệnh Docker Compose.
  • [ ] Đã phân tầng thành công Curator Model và Worker Model tối ưu 70% chi phí API.
  • [ ] Đã kết nối Bot Telegram riêng tư bảo mật danh sách allowed_user_ids.
🏢 BẠN MUỐN TRIỂN KHAI CHO CẢ PHÒNG BAN / DOANH NGHIỆP?
Đề Xuất Công Ty Tài Trợ & Đào Tạo In-House Trọn Gói

AI Tinh Gọn hỗ trợ khảo sát hiện trạng, kèm 1-1 on-premise bảo mật dữ liệu, setup hạ tầng riêng và xuất hóa đơn VAT hợp pháp cho doanh nghiệp.

⚖️ Bản quyền sở hữu trí tuệ: © 2026 AI Tinh Gọn (aitinhgon.vn) · Giấy phép Creative Commons CC BY-NC-ND 4.0. Cho phép tự học cá nhân, nghiêm cấm thương mại hóa hoặc bán lại. Giáo trình mở →

Tiến độ tự học lưu trên trình duyệt này. Chỉ đánh dấu khi đã kiểm tra sản phẩm thực hành.