Có một câu nói kinh điển trong ngành dữ liệu: "Garbage in, garbage out" (Đầu vào là rác thì đầu ra cũng là rác). Điều này không chỉ đúng với dữ liệu, mà còn đúng cả với cách bạn ra lệnh cho AI. Nếu bạn ném một file Excel 10.000 dòng vào ChatGPT và gõ cộc lốc: "Phân tích file này đi", bạn sẽ nhận lại những con số trung bình vô bổ hoặc những nhận xét hiển nhiên đến mức nực cười.
Một chuyên gia dữ liệu thực thụ không dùng AI để làm tính cộng trừ. Họ dùng AI để nhận diện các mô hình (patterns) ẩn sâu, sinh ra các câu query phức tạp, tự động hóa khâu làm sạch dữ liệu (Data Cleaning) và đóng gói Insights thành những báo cáo chuẩn C-level.
Bộ 20 prompt siêu chi tiết dưới đây được thiết kế chuyên sâu dành riêng cho Data Analysts, Researchers và cả những nhà quản lý muốn tự mình "bóc tách" số liệu. Mỗi câu lệnh đều được tối ưu hóa cấu trúc Role - Context - Rules - Output để ép AI phải suy nghĩ như một Senior Data Scientist. Hãy copy, điền biến số của bạn và xem phép màu xảy ra!
Nhóm 1: Tiền Xử Lý & Làm Sạch Dữ Liệu (Data Cleaning & Preprocessing)
Làm sạch dữ liệu chiếm tới 80% thời gian của một Data Analyst. Hãy dùng các prompt này để AI viết script xử lý hoặc tự động trích xuất dữ liệu không có cấu trúc (unstructured data).
📌 Prompt 1: Tự động hóa Pipeline làm sạch dữ liệu
Bạn là một Senior Data Engineer chuyên về Data Pipeline.
Mục tiêu: Tự động hóa Pipeline làm sạch dữ liệu.
Bối cảnh: Tôi có một tập dữ liệu [ví dụ: lịch sử giao dịch khách hàng] chứa khoảng 50,000 dòng. Các vấn đề hiện tại bao gồm: giá trị bị thiếu (Missing values) ở cột 'Tuổi' và 'Thu nhập', định dạng ngày tháng không đồng nhất (DD/MM/YYYY lẫn MM/DD/YYYY), và dữ liệu ngoại lai (Outliers) ở cột 'Giá trị đơn hàng'.
Yêu cầu:
1. Viết một hàm Python bằng thư viện Pandas để thực hiện toàn bộ quy trình làm sạch này.
2. Với cột 'Tuổi' và 'Thu nhập', không dùng phương pháp điền giá trị trung bình (mean imputation) thông thường. Hãy dùng phương pháp KNN Imputer hoặc nội suy tuyến tính và giải thích lý do.
3. Xử lý Outliers bằng phương pháp Z-score (ngưỡng 3).
4. Định dạng đầu ra: Code Python hoàn chỉnh (kèm type hinting) và 3 gạch đầu dòng giải thích tư duy đằng sau.
📌 Prompt 2: Trích xuất siêu dữ liệu (Data Extraction) từ Text thô
Bạn là chuyên gia Xử lý ngôn ngữ tự nhiên (NLP) và Khai phá dữ liệu.
Mục tiêu: Trích xuất thông tin có cấu trúc từ đoạn văn bản vô tổ chức.
Bối cảnh: Tôi cần trích xuất dữ liệu từ đoạn văn bản y tế / hợp đồng pháp lý thô sau: [Dán đoạn văn bản thô].
Yêu cầu:
1. Nhận diện các thực thể chính: Tên bệnh nhân/Đối tác, Ngày tháng, Số tiền/Liều lượng, Các điều khoản bồi thường/Chẩn đoán bệnh.
2. Bỏ qua các thông tin râu ria, cảm thán.
3. Nếu một trường thông tin không có trong văn bản, hãy ghi giá trị là `null` (không được tự bịa ra).
4. Định dạng đầu ra BẮT BUỘC: Chuỗi JSON hợp lệ (Valid JSON format) với các keys rõ ràng bằng tiếng Anh (ví dụ: patient_name, diagnosis_date, total_amount).
📌 Prompt 3: Chuẩn hóa Regex cho dữ liệu rác
Đóng vai trò là Regex Master.
Mục tiêu: Viết biểu thức chính quy (Regex) để làm sạch dữ liệu rác.
Bối cảnh: Tôi đang xử lý một cột chứa thông tin chuỗi rất lộn xộn từ hệ thống CRM cũ. Dữ liệu mẫu đang có dạng: "KH: Nguyen Van A - SDT: +84-988.123.456 - Email: nva_123@gmail.com - Note: Khách VIP".
Yêu cầu:
1. Viết Regex trong Python để tách chính xác chuỗi trên thành 4 nhóm (Groups): Tên (bỏ các chữ KH:), Số điện thoại (chuẩn hóa về định dạng 0988123456), Email, và Ghi chú.
2. Ràng buộc: Regex phải xử lý được các trường hợp SĐT không có dấu gạch ngang hoặc Email có ký tự đặc biệt.
3. Giải thích chi tiết ý nghĩa của từng cụm ký tự trong Regex.
📌 Prompt 4: Sinh dữ liệu mẫu (Mock Data) theo quy luật thống kê
Bạn là một Chuyên gia Data Science.
Mục tiêu: Sinh bộ dữ liệu giả lập (Mock Dataset) tuân theo quy luật thống kê.
Bối cảnh: Tôi cần một bộ dữ liệu để test model Machine Learning về khả năng Rời bỏ của khách hàng (Churn Prediction).
Yêu cầu:
1. Viết một script Python (dùng Numpy và Pandas) để sinh ra 5000 dòng dữ liệu với 6 cột: CustomerID, Age, MonthlyCharge, Tenure, NumSupportTickets, Churn.
2. Quy luật toán học BẮT BUỘC:
- Cột Age tuân theo phân phối chuẩn (Normal Distribution), mean = 35, std = 10.
- Có sự tương quan tuyến tính thuận giữa NumSupportTickets và xác suất Churn.
- Có sự tương quan tuyến tính nghịch giữa Tenure và Churn.
3. Script phải chạy được ngay và in ra hệ số tương quan (Correlation Matrix) để chứng minh.
📌 Prompt 5: Phát hiện sự bất thường (Anomaly Detection) cơ bản
Bạn là chuyên gia Phân tích rủi ro hệ thống.
Mục tiêu: Phát hiện sự bất thường (Anomaly Detection) cơ bản trong chuỗi thời gian.
Bối cảnh: Tôi cung cấp mảng dữ liệu Time-series về lượng truy cập website theo từng giờ trong 7 ngày qua: [Dán chuỗi dữ liệu dạng mảng hoặc CSV].
Yêu cầu:
1. Áp dụng tư duy phân tích đường cơ sở (Baseline Analysis) để tìm ra quy luật theo ngày/đêm.
2. Chỉ ra chính xác 3 khung giờ có dấu hiệu bất thường (lượt truy cập đột biến hoặc sụt giảm vô lý).
3. Sử dụng mô hình suy luận logic: Đưa ra 3 giả thuyết kinh doanh tại sao sự bất thường đó lại xảy ra (ví dụ: Chạy chiến dịch Ads, Server downtime, Bot attack).
Nhóm 2: Sinh Script Phân Tích (Python & SQL Nâng Cao)
AI có thể viết SQL giỏi hơn phần lớn nhân viên Junior. Hãy dùng nó để viết các truy vấn nhiều tầng lớp (Window Functions, CTEs).
📌 Prompt 6: SQL - Phân tích Cohort (Cohort Analysis)
Bạn là Lead Data Engineer.
Mục tiêu: Viết SQL Query để Phân tích Cohort (Cohort Analysis).
Bối cảnh: Tôi có bảng `Users` (user_id, created_at) và bảng `Orders` (order_id, user_id, order_date) trong hệ thống PostgreSQL.
Yêu cầu:
1. Viết câu truy vấn PostgreSQL sử dụng CTE (Common Table Expressions) để thực hiện Phân tích giữ chân khách hàng (Cohort Retention Analysis) theo THÁNG.
2. Đầu ra của câu query phải hiển thị: Tháng gia nhập (Cohort Month), Tổng số User của tháng đó, và Tỷ lệ phần trăm user quay lại mua hàng ở Tháng thứ 1, Tháng thứ 2, Tháng thứ 3.
3. Chèn comment vào code SQL để giải thích từng CTE hoạt động như thế nào.
Bạn là một SQL Master.
Mục tiêu: Viết câu truy vấn SQL với Window Functions phức tạp.
Bối cảnh: Tôi đang sử dụng BigQuery. Bảng `Sales` gồm: date, store_id, product_id, revenue. Bài toán kinh doanh: Tìm ra top 3 sản phẩm mang lại doanh thu cao nhất cho MỖI cửa hàng trong tháng trước. Đồng thời tính tỷ trọng doanh thu (phần trăm) của sản phẩm đó so với tổng doanh thu của chính cửa hàng đó.
Yêu cầu:
1. Viết code truy vấn chuẩn và dễ đọc.
2. Bắt buộc sử dụng Window Functions (`RANK()` hoặc `ROW_NUMBER()`, và `SUM() OVER()`).
3. Tránh dùng nhiều Sub-queries làm giảm hiệu năng.
📌 Prompt 8: Python - Áp dụng thuật toán ML (Phân cụm)
Bạn là Senior Data Scientist.
Mục tiêu: Viết script Python phân cụm khách hàng (Clustering).
Bối cảnh: Tôi có dữ liệu RFM (Recency, Frequency, Monetary) của 10.000 khách hàng.
Yêu cầu:
1. Viết script Python dùng thư viện Scikit-learn để phân cụm khách hàng bằng thuật toán K-Means.
2. Quy trình bắt buộc:
- Scale dữ liệu bằng StandardScaler.
- Viết hàm tìm số cụm K tối ưu bằng phương pháp Elbow và in ra biểu đồ.
- Fit mô hình với K=4.
- Gán nhãn cho 4 cụm bằng tên tiếng Anh mang tính kinh doanh (ví dụ: "Champions", "At Risk", "Newbies", "Lost") dựa trên giá trị trung tâm (Centroids) của chúng.
📌 Prompt 9: Python - Phân tích AB Testing (Kiểm định thống kê)
Bạn là một nhà Thống kê học (Statistician).
Mục tiêu: Phân tích kết quả A/B Testing và tính toán p-value.
Bối cảnh: Tôi vừa chạy một chiến dịch A/B Testing cho nút Đăng ký. Nhóm A (Control): Lượt xem = 5000, Lượt đăng ký = 450. Nhóm B (Variant): Lượt xem = 5200, Lượt đăng ký = 530.
Yêu cầu:
1. Sử dụng kiểm định Chi-Square hoặc Z-test (2 proportions) để tính toán p-value.
2. Đánh giá xem kết quả này có ý nghĩa thống kê (Statistical Significance) với độ tin cậy 95% hay không.
3. Viết kết luận bằng một đoạn văn bản dễ hiểu để báo cáo cho Giám đốc Marketing (người không rành về toán), nói rõ: Có nên triển khai Nhóm B toàn hệ thống hay không?
📌 Prompt 10: Tối ưu hóa truy vấn SQL đang bị chậm
Bạn là một Database Administrator kỳ cựu.
Mục tiêu: Tối ưu hóa truy vấn SQL đang bị chậm.
Bối cảnh: Câu truy vấn MySQL sau đây chạy mất 45 giây để ra kết quả: [Dán câu SQL có nhiều JOIN và LIKE '%text%'].
Yêu cầu:
1. Phân tích Execution Plan (trên lý thuyết) và chỉ ra 3 nguyên nhân cốt lõi gây chậm (ví dụ: Full Table Scan, thiếu Index ở cột JOIN, dùng hàm trên cột điều kiện).
2. Viết lại câu SQL tối ưu hơn.
3. Đề xuất cú pháp tạo Index (CREATE INDEX) phù hợp cho các bảng này.
Nhóm 3: Phân Tích Khám Phá & Nhận Diện Mẫu (EDA)
Biến AI thành một "thám tử" dữ liệu. Hãy yêu cầu nó đào sâu vào mối quan hệ giữa các biến thay vì chỉ tính toán cơ bản.
Bạn là một Data Analyst sắc sảo.
Mục tiêu: Khám phá dữ liệu đa chiều (EDA - Exploratory Data Analysis).
Bối cảnh: Tôi có tập dữ liệu CSV về [Chủ đề, ví dụ: Doanh số bán lẻ siêu thị], gồm các cột: [Danh sách Tên cột kèm định dạng dữ liệu].
Yêu cầu:
1. Lập kế hoạch EDA: Không phân tích ngay, hãy đưa ra danh sách 5 câu hỏi kinh doanh (Business Questions) sâu sắc nhất cần trả lời từ bộ dữ liệu này.
2. Với mỗi câu hỏi, chỉ rõ tôi cần dùng những cột nào và vẽ loại biểu đồ gì (Scatter, Boxplot, Heatmap) để tìm ra câu trả lời.
📌 Prompt 12: Nhận diện nguyên nhân sụt giảm (Root Cause Analysis)
Bạn là một Data Analyst tư duy sắc bén.
Mục tiêu: Nhận diện nguyên nhân sụt giảm (Root Cause Analysis).
Bối cảnh: Tình huống: Doanh thu tháng 10 của công ty sụt giảm 20% so với tháng 9. Bảng dữ liệu phân rã doanh thu theo Kênh bán hàng (Online/Offline) và Dòng sản phẩm (Cao cấp/Tầm trung): [Dán dữ liệu dạng bảng Markdown hoặc CSV].
Yêu cầu:
1. Sử dụng phương pháp "Phân rã thành phần" (Decomposition).
2. Phân tích xem sự sụt giảm 20% này xuất phát chủ yếu từ mảng nào?
3. Đánh giá nguyên nhân do số lượng đơn hàng giảm hay do giá trị trung bình đơn (AOV) giảm? Đưa ra kết luận trọng tâm.
📌 Prompt 13: Phân tích tương quan đa biến (Multivariate Analysis)
Bạn là một Chuyên gia Thống kê (Statistician).
Mục tiêu: Phân tích tương quan đa biến (Multivariate Analysis).
Bối cảnh: Tôi có kết quả của một ma trận tương quan giữa 5 biến: Tuổi, Thu nhập, Điểm tín dụng, Số tiền vay, Tỷ lệ vỡ nợ. [Cung cấp hệ số tương quan chính, ví dụ: Thu nhập và Tỷ lệ vỡ nợ: -0.65].
Yêu cầu:
1. Phân tích chuyên sâu và nhận diện các cặp biến có quan hệ mạnh nhất (thuận và nghịch).
2. Cảnh báo về hiện tượng Đa cộng tuyến (Multicollinearity) nếu có.
3. Dịch những hệ số toán học này thành 3 "Quy luật hành vi khách hàng" bằng ngôn ngữ kinh doanh thông thường.
📌 Prompt 14: Sinh prompt cho Data Visualization (Màu sắc & Tâm lý học)
Bạn là chuyên gia Thiết kế Thông tin (Data Storytelling).
Mục tiêu: Sinh prompt tư vấn Data Visualization (Màu sắc & Tâm lý học).
Bối cảnh: Tôi chuẩn bị vẽ biểu đồ đường (Line chart) so sánh Doanh thu và Chi phí trong 12 tháng để trình bày trước Hội đồng Quản trị.
Yêu cầu:
Đừng viết code, hãy tư vấn:
1. Nên chọn bảng màu (Color Palette) nào để làm nổi bật khoảng cách (Lợi nhuận) giữa Doanh thu và Chi phí, dựa trên tâm lý học màu sắc doanh nghiệp?
2. Thiết kế lưới (grid lines), trục (axes) và chú thích (legend) như thế nào để tuân thủ nguyên tắc "Giảm tỷ lệ Data-ink" của Edward Tufte (Tối giản hóa biểu đồ)?
📌 Prompt 15: Dự báo chuỗi thời gian (Time-series Forecasting setup)
Bạn là một Chuyên gia Data Science mảng Time-series.
Mục tiêu: Tư vấn lựa chọn mô hình dự báo chuỗi thời gian (Time-series Forecasting).
Bối cảnh: Tôi cần dự báo doanh số của [Tên mặt hàng] cho 3 tháng tới. Tôi có dữ liệu lịch sử 3 năm qua, mang tính chu kỳ cao theo từng dịp lễ Tết.
Yêu cầu:
1. Đánh giá việc sử dụng mô hình ARIMA so với mô hình Prophet (của Facebook).
2. Đưa ra bảng so sánh chi tiết về: Khả năng xử lý tính mùa vụ (Seasonality), Khả năng xử lý ngày lễ (Holidays), và Độ khó khi điều chỉnh tham số.
3. Đề xuất phương án mô hình phù hợp nhất cho dữ liệu của tôi.
Nhóm 4: Báo Cáo C-Level & Data Storytelling
Sếp không quan tâm đến P-value hay RMSE. Sếp chỉ quan tâm: "Chuyện gì đang xảy ra?" và "Chúng ta phải làm gì?".
📌 Prompt 16: Dịch số liệu thành Data Storytelling (Kể chuyện bằng dữ liệu)
Bạn là Chuyên gia Data Storytelling.
Mục tiêu: Dịch số liệu khô khan thành Câu chuyện Dữ liệu.
Bối cảnh: Tôi có các số liệu sau về chiến dịch ra mắt sản phẩm: [Dán 4-5 gạch đầu dòng số liệu, ví dụ: Traffic tăng 40%, Conversion rate 1.5%, CAC là $15].
Yêu cầu:
1. Chuyển đổi các con số thành một Câu chuyện Dữ liệu áp dụng mô hình "Tình huống - Xung đột - Giải pháp" (Situation - Complication - Resolution).
2. Giọng văn: Sôi nổi, truyền cảm hứng.
3. Kết quả phải trả lời được câu hỏi: Số liệu này chứng minh được điều gì về năng lực của đội ngũ?
📌 Prompt 17: Tạo bản tóm tắt Executive Summary cho C-Level
Bạn là Giám đốc Dữ liệu (Chief Data Officer).
Mục tiêu: Viết bản tóm tắt Executive Summary cho C-Level.
Bối cảnh: Tôi đưa cho bạn một báo cáo phân tích rủi ro tín dụng dài 20 trang. Điểm chính: [Dán các điểm chính].
Yêu cầu:
1. Viết một bản Executive Summary (Tóm tắt cho Ban Giám đốc) dài ĐÚNG 3 đoạn văn.
2. Cấu trúc:
- Đoạn 1: Bức tranh toàn cảnh (Chỉ dùng những con số cốt lõi nhất).
- Đoạn 2: Mối đe dọa lớn nhất (Rủi ro trọng tâm đang rình rập).
- Đoạn 3: 2 Quyết định chiến lược cần sếp duyệt ngay trong cuộc họp chiều nay.
3. Giọng văn: Cực kỳ đanh thép, thẳng thắn, không dùng từ ngữ kỹ thuật (Jargon).
📌 Prompt 18: Lên dàn ý (Wireframe) cho Dashboard PowerBI / Tableau
Bạn là một Chuyên gia BI (Business Intelligence) Designer.
Mục tiêu: Lên dàn ý (Wireframe) cho Dashboard PowerBI / Tableau.
Bối cảnh: Tôi cần thiết kế Dashboard cho bộ phận [Ví dụ: Quản lý Chuỗi cung ứng / Kho]. User cuối là Quản lý kho, xem báo cáo hằng ngày trên máy tính.
Yêu cầu:
Lên Wireframe chi tiết với cấu trúc:
1. Hàng trên cùng (Top Row): Liệt kê 4 KPIs (Scorecards) quan trọng nhất.
2. Cột bên trái: Các bộ lọc (Slicers/Filters) bắt buộc phải có.
3. Phần trung tâm: 3 biểu đồ chính (Nêu rõ loại biểu đồ và Trục X/Y).
4. Đảm bảo quy luật đọc từ trái sang phải, từ trên xuống dưới (F-pattern).
📌 Prompt 19: Dịch ngữ nghĩa của mô hình (Model Interpretability - SHAP/LIME)
Bạn là Chuyên gia Machine Learning (Explainable AI).
Mục tiêu: Dịch ngữ nghĩa của mô hình (Model Interpretability - SHAP/LIME).
Bối cảnh: Mô hình Random Forest dự đoán Khách hàng A sẽ Churn với xác suất 85%. SHAP values top 3: 1. Số lần gọi hỗ trợ = 5 (dương), 2. Thời gian sử dụng = 2 tháng (dương), 3. Điểm NPS = 4 (dương).
Yêu cầu:
1. Viết đoạn giải thích ngắn (3-4 câu) bằng ngôn ngữ của nhân viên CSKH (không nhắc đến chữ Random Forest, SHAP hay Machine Learning).
2. Giải thích tại sao hệ thống báo động đỏ đối với khách hàng này.
3. Nhân viên CSKH nên bắt đầu cuộc gọi bằng chủ đề gì để xoa dịu họ.
📌 Prompt 20: Sinh nội dung cho buổi thuyết trình dữ liệu (Slide Deck Content)
Bạn là Chuyên gia Data Presentation (Thuyết trình dữ liệu).
Mục tiêu: Sinh kịch bản cho buổi thuyết trình dữ liệu (Slide Deck Content).
Bối cảnh: Kết quả phân tích: "Doanh số khu vực miền Nam tăng 15% nhờ chiến dịch giảm giá, nhưng lợi nhuận biên (profit margin) giảm 5% do chi phí vận chuyển tăng vọt".
Yêu cầu:
1. Thiết kế kịch bản cho 3 slide thuyết trình (Pitch deck) liên tiếp.
2. Với mỗi slide, cung cấp:
- Headline: Phải là thông điệp hành động, không dùng tiêu đề chung chung.
- Nội dung slide: Cực ngắn, dạng bullet.
- Lời thoại (Speaker notes): Lời diễn giải mạch lạc và thuyết phục.
Hành động ngay: Nếu bạn đang đau đầu với một bảng dữ liệu lộn xộn, hãy bắt đầu bằng Prompt số 11. Hãy yêu cầu AI đặt câu hỏi cho dữ liệu của bạn trước khi bạn lao vào vẽ biểu đồ. Một câu hỏi đúng giá trị hơn 10 cái biểu đồ đẹp nhưng vô dụng.
Lời kết: Trí tuệ nhân tạo sẽ không thay thế Data Analysts. Nó thay thế những người chỉ biết dùng Excel để tính tổng. Bằng cách ứng dụng Prompt Engineering chuẩn cấu trúc và chi tiết, bạn đang tạo ra một "phiên bản phòng Lab" thu nhỏ cho riêng mình, nơi mọi dữ liệu thô đều có thể luyện thành vàng.