Giáo trình tự học miễn phí · Dịch vụ hỗ trợ theo nhu cầu.
Bài 0435phút ước tínhCơ bản đến Nâng cao
4. Tối Ưu Chi Phí & Bộ Nhớ: Kỹ Thuật Context Caching Trên Gemini Giảm 90% Tiền Token
Khai thác cơ chế Context Caching độc quyền của Google: Lưu trữ sẵn kho sách 1-2 triệu tokens trên RAM của Google, giảm 90% chi phí đọc và giảm 80% độ trễ.
💰 Cơ Chế Context Caching Trên Gemini 2.5
- Tạo Cache (1 lần duy nhất): Nạp toàn bộ tài liệu 1,000,000 tokens và gán thời gian tồn tại (TTL).
- Truy vấn nhiều lần: Các truy vấn tiếp theo chỉ tính phí đọc cache (Cache Read = 0.025$/1M token), tiết kiệm tới 90% chi phí so với nạp lại từ đầu.
from google import genai
from google.genai import types
client = genai.Client(api_key="YOUR_GEMINI_API_KEY")
# 1. Tạo bản Cache lưu trữ 500 trang quy trình nội bộ
cache = client.caches.create(
model="gemini-2.5-flash",
config=types.CreateCachedContentConfig(
contents=["[NỘI DUNG TOÀN BỘ 500 TRANG QUY CHẾ VẬN HÀNH DOANH NGHIỆP]"],
display_name="company_rules_cache_2026",
ttl="86400s", # 24 giờ
)
)
# 2. Đặt câu hỏi truy vấn từ Cache với độ trễ siêu thấp
response = client.models.generate_content(
model="gemini-2.5-flash",
contents="Theo quy chế, hạn mức công tác phí khách sạn tại TP.HCM là bao nhiêu?",
config=types.GenerateContentConfig(
cached_content=cache.name,
)
)
print(response.text)
Thực hành
Thực hành và tự đánh giá
Tạo một bản Cache chứa file tài liệu PDF quy trình của công ty bạn, đặt TTL 1 giờ và thực hiện 3 câu hỏi liên tiếp để kiểm tra tốc độ phản hồi.
🏢 BẠN MUỐN TRIỂN KHAI CHO CẢ PHÒNG BAN / DOANH NGHIỆP?
Đề Xuất Công Ty Tài Trợ & Đào Tạo In-House Trọn Gói
AI Tinh Gọn hỗ trợ khảo sát hiện trạng, kèm 1-1 on-premise bảo mật dữ liệu, setup hạ tầng riêng và xuất hóa đơn VAT hợp pháp cho doanh nghiệp.
⚖️ Bản quyền sở hữu trí tuệ: © 2026 AI Tinh Gọn (aitinhgon.vn) · Giấy phép Creative Commons CC BY-NC-ND 4.0. Cho phép tự học cá nhân, nghiêm cấm thương mại hóa hoặc bán lại.
Giáo trình mở →
Tiến độ tự học lưu trên trình duyệt này. Chỉ đánh dấu khi đã kiểm tra sản phẩm thực hành.