Lộ trình cá nhânGoogle AI & Gemini Ecosystem: Làm Chủ Gemini 2.5 Pro, Gemini 2.5 Flash, Multimodal Live API, Gemma 3 & DeepMind Agent Tooling
4/8

Giáo trình tự học miễn phí · Dịch vụ hỗ trợ theo nhu cầu.

Bài 0435phút ước tínhCơ bản đến Nâng cao

4. Tối Ưu Chi Phí & Bộ Nhớ: Kỹ Thuật Context Caching Trên Gemini Giảm 90% Tiền Token

Khai thác cơ chế Context Caching độc quyền của Google: Lưu trữ sẵn kho sách 1-2 triệu tokens trên RAM của Google, giảm 90% chi phí đọc và giảm 80% độ trễ.

💰 Cơ Chế Context Caching Trên Gemini 2.5

  • Tạo Cache (1 lần duy nhất): Nạp toàn bộ tài liệu 1,000,000 tokens và gán thời gian tồn tại (TTL).
  • Truy vấn nhiều lần: Các truy vấn tiếp theo chỉ tính phí đọc cache (Cache Read = 0.025$/1M token), tiết kiệm tới 90% chi phí so với nạp lại từ đầu.
example.py
from google import genai
from google.genai import types

client = genai.Client(api_key="YOUR_GEMINI_API_KEY")

# 1. Tạo bản Cache lưu trữ 500 trang quy trình nội bộ
cache = client.caches.create(
    model="gemini-2.5-flash",
    config=types.CreateCachedContentConfig(
        contents=["[NỘI DUNG TOÀN BỘ 500 TRANG QUY CHẾ VẬN HÀNH DOANH NGHIỆP]"],
        display_name="company_rules_cache_2026",
        ttl="86400s", # 24 giờ
    )
)

# 2. Đặt câu hỏi truy vấn từ Cache với độ trễ siêu thấp
response = client.models.generate_content(
    model="gemini-2.5-flash",
    contents="Theo quy chế, hạn mức công tác phí khách sạn tại TP.HCM là bao nhiêu?",
    config=types.GenerateContentConfig(
        cached_content=cache.name,
    )
)

print(response.text)
Thực hành

Thực hành và tự đánh giá

Tạo một bản Cache chứa file tài liệu PDF quy trình của công ty bạn, đặt TTL 1 giờ và thực hiện 3 câu hỏi liên tiếp để kiểm tra tốc độ phản hồi.

⚖️ Bản quyền sở hữu trí tuệ: © 2026 AI Tinh Gọn (aitinhgon.vn) · Giấy phép Creative Commons CC BY-NC-ND 4.0. Cho phép tự học cá nhân, nghiêm cấm thương mại hóa hoặc bán lại. Giáo trình mở →

Tiến độ tự học lưu trên trình duyệt này. Chỉ đánh dấu khi đã kiểm tra sản phẩm thực hành.