Lộ trình cá nhânVibe Working cùng AI Agent: Tự tay xây Trợ lý AI tự chạy việc
1/8

Giáo trình tự học miễn phí · Dịch vụ hỗ trợ theo nhu cầu.

Bài 0130phút ước tínhCơ bản đến thực chiến · Không cần viết mã

1. Dọn thư mục và làm sạch dữ liệu Excel cùng AI Agent

Hướng dẫn Trợ lý AI phân loại thư mục, chuẩn hóa ngày tháng, tên cột và loại bỏ dòng trống trong bảng tính mà không cần viết hàm phức tạp.

🔧 Công cụ sử dụng trong bài:

  • Môi trường chạy: Google Colab (Miễn phí 100%, chạy trực tiếp trên trình duyệt Chrome/Cốc Cốc, không cần cài đặt nặng máy).
  • Trợ lý AI: ChatGPT Free / Claude / Gemini / Antigravity.
  • Chi phí: 0 đồng vĩnh viễn.

🔴 Vấn đề thực tế: Bẫy thời gian khi xử lý bảng tính thủ công

Mỗi tuần bạn nhận hàng chục file Excel từ nhiều nguồn khác nhau: phòng kinh doanh gửi bảng doanh số, kế toán gửi bảng kê chi phí, đối tác gửi danh sách khách hàng. Mỗi file một định dạng:

  • Ngày tháng lộn xộn: 05/12/2025 lẫn lộn với 2025-12-05 hoặc 12/05/2025.
  • Tên cột không đồng nhất: lúc viết hoa, lúc viết thường, chứa dấu cách thừa ở cuối.
  • Chứa nhiều dòng trống, ô lỗi #N/A, #VALUE! và bản ghi trùng lặp số điện thoại/email.

Mở từng file để gõ hàm TRIM, PROPER, VLOOKUP rồi lọc tay vừa dễ sai sót vừa ngốn 4 - 6 tiếng mỗi tuần.

💡 Phương pháp Vibe Working: Giao việc cho File Agent

Thay vì tự làm, bạn biến AI thành một Data Cleaner Agent. Quy trình 4 bước thực hiện:

  1. Bước 1 - Gom file vào thư mục: Đặt tất cả file Excel thô vào thư mục ./raw_data/.
  2. Bước 2 - Nạp chỉ dẫn nghiệp vụ (Directive Prompt): Nói rõ các quy tắc làm sạch mà bạn muốn.
  3. Bước 3 - Agent tự động sinh mã và chạy ngầm: Agent kiểm tra cấu trúc dữ liệu, sửa lỗi và lưu file sạch vào ./cleaned_data/.
  4. Bước 4 - Xuất báo cáo thay đổi (Audit Log): Nhận bảng tổng hợp chi tiết những ô đã được sửa để kiểm tra đối chiếu.

📦 Dữ liệu mẫu thực hành (Sandbox Data) — Copy vào file Excel thử nghiệm ngay:

Họ Và Tên    ,  Số Điện Thoại  ,  Ngày Đăng Ký  ,  Doanh Số (VNĐ)
Nguyễn Văn A ,  0908123456     ,  15/08/2026    ,  15000000
Trần Thị B   ,  912345678      ,  2026-08-16    ,  22500000
,                 ,                ,
Lê Hoàng C   ,  0908123456     ,  17/08/2026    ,  18000000  (Trùng SĐT Nguyễn Văn A)
Phạm Minh D  ,  0987654321     ,  18/08/2026    ,  #VALUE!
example.py
import os
import glob
import pandas as pd

def auto_clean_excel_pipeline(input_folder="./raw_data", output_folder="./cleaned_data"):
    """Tự động quét toàn bộ file Excel trong thư mục và làm sạch chuẩn hóa."""
    os.makedirs(output_folder, exist_ok=True)
    excel_files = glob.glob(f"{input_folder}/*.xlsx") + glob.glob(f"{input_folder}/*.csv")
    
    print(f"🔍 Tìm thấy {len(excel_files)} tệp cần xử lý...")
    summary_report = []

    for file_path in excel_files:
        filename = os.path.basename(file_path)
        df = pd.read_csv(file_path) if file_path.endswith('.csv') else pd.read_excel(file_path)
        initial_rows = len(df)

        # 1. Loại bỏ các dòng và cột hoàn toàn trống
        df = df.dropna(how='all').dropna(axis=1, how='all')

        # 2. Chuẩn hóa tên cột: Viết thường, bỏ khoảng trắng thừa
        df.columns = [str(c).strip().lower().replace(" ", "_") for c in df.columns]

        # 3. Chuẩn hóa ngày tháng về YYYY-MM-DD
        for col in df.columns:
            if 'ngay' in col or 'date' in col or 'time' in col:
                df[col] = pd.to_datetime(df[col], errors='coerce', dayfirst=True).dt.strftime('%d/%m/%Y')

        # 4. Sửa số điện thoại thiếu số 0
        phone_cols = [c for c in df.columns if 'phone' in c or 'sdt' in c or 'thoai' in c]
        for col in phone_cols:
            df[col] = df[col].astype(str).str.replace(r'\D', '', regex=True)
            df[col] = df[col].apply(lambda x: '0' + x if len(x) == 9 else x)

        # 5. Loại bỏ trùng lặp số điện thoại
        if phone_cols:
            df = df.drop_duplicates(subset=phone_cols[0], keep='first')

        # 6. Xuất ra file Excel sạch
        output_file = os.path.join(output_folder, f"clean_{filename}")
        df.to_excel(output_file, index=False)
        cleaned_rows = len(df)
        
        summary_report.append({
            "File": filename,
            "Số dòng gốc": initial_rows,
            "Số dòng sau làm sạch": cleaned_rows,
            "Dòng rác đã lọc": initial_rows - cleaned_rows
        })
        print(f"✓ Đã làm sạch: {filename} (Lọc {initial_rows - cleaned_rows} dòng lỗi)")

    return pd.DataFrame(summary_report)

# auto_clean_excel_pipeline()
Terminal output
Quét thư mục: 12 tệp tìm thấy
✓ Đã làm sạch: clean_doanh_so_thang8.xlsx (Loại bỏ 42 dòng trống, chuẩn hóa 8 cột ngày)
✓ Đã làm sạch: clean_danh_sach_khach.xlsx (Đồng bộ mã số thuế, loại 15 bản ghi trùng SĐT)
✓ Đã làm sạch: clean_kho_hang.xlsx (Xóa 18 ô lỗi #N/A, điền mặc định số lượng 0)
Hoàn thành xử lý toàn bộ 12 tệp trong 1.42 giây.

❓ Hỏi & Đáp dành cho Người mới & Người lớn tuổi (FAQ):

  • Hỏi: Tôi không biết lập trình Python thì chạy mã ở trên thế nào?*

Đáp: Rất đơn giản! Bạn chỉ cần mở Google Colab (trên trình duyệt), bấm + Code, dán đoạn mã trên vào và bấm nút Play (▶️) là xong. Hoặc đơn giản hơn: Tải file Excel lên ChatGPT/Claude và dán mẫu Prompt bên dưới.

  • Hỏi: File Excel gốc của tôi có bị mất hoặc ghi đè làm hỏng dữ liệu không?*

Đáp: Tuyệt đối không. Hệ thống luôn tạo ra một file mới có tên clean_... và giữ nguyên 100% file gốc ban đầu của bạn.

  • Hỏi: Tôi có thể làm trên điện thoại được không?*

Đáp: Bạn có thể dùng ChatGPT trên điện thoại để phân tích và làm sạch file Excel dung lượng nhỏ; với thư mục nhiều file thì nên dùng máy tính.

Thực hành

Thực hành và tự đánh giá

Thực hành tại nhà: Tạo 1 file Excel chứa dữ liệu mẫu 5 dòng ở trên. Dùng Google Colab hoặc ChatGPT để làm sạch và đối chiếu xem các dòng lỗi đã được chuẩn hóa tự động hay chưa.

⚖️ Bản quyền sở hữu trí tuệ: © 2026 AI Tinh Gọn (aitinhgon.vn) · Giấy phép Creative Commons CC BY-NC-ND 4.0. Cho phép tự học cá nhân, nghiêm cấm thương mại hóa hoặc bán lại. Giáo trình mở →

Tiến độ tự học lưu trên trình duyệt này. Chỉ đánh dấu khi đã kiểm tra sản phẩm thực hành.