Kumaclouds
Góc nhìn & Xu hướng

Vì sao nhiều pilot AI chết trước khi vào production

MIT, RAND và Gartner đo những thứ khác nhau, nhưng cùng cho thấy một vấn đề: nhiều nút thắt của AI nằm ngoài bản thân mô hình.

Kumaclouds Technology 10 Tháng 8, 2026 10 phút đọc
Vì sao nhiều pilot AI chết trước khi vào production

MIT ghi nhận 95% pilot GenAI trong mẫu chưa tạo tác động tài chính đo được trên P&L. RAND dẫn lại ước tính hơn 80% dự án AI thất bại — gấp đôi dự án IT không AI — rồi phỏng vấn 65 chuyên gia để tìm nguyên nhân. Gartner dự báo hơn 40% dự án AI agent bị huỷ trước cuối 2027. Điểm chung: nhiều nút thắt nằm ở phía tổ chức.

AIAI AgentChuyển đổi sốQuản trị dự ánDoanh nghiệp

RAND dẫn lại ước tính hơn 80% dự án AI thất bại. Tại sao?

Ở các doanh nghiệp lớn, mỗi làn sóng AI thường bắt đầu bằng rất nhiều ý tưởng được thử song song, rồi mới sàng lọc những hướng đáng để đầu tư tiếp.

Nhưng có một nghịch lý: ý tưởng trên slide thường màu hồng hơn rất nhiều so với lúc triển khai thật.

Trên slide thì mọi thứ đều có lời giải: private model, Capex và Opex nhìn hợp lý, ROI hấp dẫn, điểm hoà vốn đúng kỳ vọng. PoC cũng rất khả thi. Khi chạy thật, chất lượng có thể không tới kỳ vọng, và phần chìm của tảng băng bắt đầu lộ ra.

Và tới đây, vấn đề không còn chỉ là kỹ thuật. Người làm ra pilot chưa chắc là người phải sống với nó. Đội xây được đo bằng "có chạy được không". Đội nhận được đo bằng "hỏng lúc hai giờ sáng thì ai trực".

Đó là khoảng cách giữa một ý tưởng AI nhìn rất đẹp và một thứ thực sự sống được trong doanh nghiệp.

Ba nguồn độc lập, ba cách nhìn, cùng chỉ về một hướng

MIT/NANDA — báo cáo nghiên cứu. Dự án NANDA công bố báo cáo The GenAI Divide: State of AI in Business 2025, dựa trên 52 cuộc phỏng vấn lãnh đạo, khảo sát 153 người quản lý và phân tích 300 trường hợp triển khai AI công khai. Kết quả: 95% pilot GenAI trong mẫu chưa tạo tác động tài chính đo được trên P&L. Nhóm nghiên cứu nói rõ vấn đề không nằm ở chất lượng mô hình mà ở khoảng cách học hỏi giữa công cụ và tổ chức.

RAND — phỏng vấn chuyên gia. Báo cáo The Root Causes of Failure for Artificial Intelligence Projects and How They Can Succeed dẫn lại ước tính hơn 80% dự án AI thất bại — gấp đôi tỷ lệ của các dự án công nghệ thông tin không có thành phần AI — sau đó phỏng vấn có cấu trúc 65 nhà khoa học dữ liệu và kỹ sư nhiều kinh nghiệm để tìm nguyên nhân. Giá trị của báo cáo nằm ở phần nguyên nhân, không nằm ở con số 80%.

Gartner — dự báo. Hãng phân tích này dự báo hơn 40% dự án AI agent sẽ bị huỷ trước cuối năm 2027, với ba nguyên nhân được nêu: chi phí leo thang, giá trị kinh doanh không rõ ràng, và kiểm soát rủi ro không đủ.

Ba thẻ so sánh ba nguồn: MIT Project NANDA — 95% pilot GenAI trong mẫu chưa tạo tác động đo được lên P&L, từ 300 triển khai công khai. RAND — hơn 80% dự án AI thất bại, ước tính RAND dẫn lại chứ không tự đo, gấp khoảng hai lần dự án IT không có AI. Gartner — dự báo hơn 40% dự án AI agent bị huỷ trước cuối 2027. Kết luận chung: nhiều nút thắt quyết định thành bại nằm ngoài bản thân mô hình.

Ba nguồn này không đo cùng một thứ. Gartner đưa ra dự báo, RAND tổng hợp kinh nghiệm của người trong nghề, MIT đo trên một mẫu triển khai cụ thể. Không thể cộng chúng lại thành một con số chung — nhưng cả ba đều chỉ về cùng một hướng, và đó là điều đáng chú ý hơn bản thân từng con số.

Một lưu ý khi đọc: những con số này không nói AI không hiệu quả. Chúng nói phần lớn tổ chức chưa đưa được AI từ bàn thử nghiệm ra tới chỗ tạo ra tiền. Đó là hai chuyện khác nhau.

Nhiều nút thắt nằm ở tổ chức, không chỉ ở mô hình

Đây là điểm hội tụ rõ nhất giữa các nguồn, và cũng là điểm hay bị bỏ qua nhất khi doanh nghiệp mổ xẻ một pilot thất bại.

RAND chỉ ra năm nguyên nhân gốc: lãnh đạo hiểu sai hoặc truyền đạt sai bài toán cần giải; tổ chức không có đủ dữ liệu để mô hình làm được việc; đội ngũ chạy theo công nghệ mới thay vì giải quyết vấn đề của người dùng; hạ tầng không đủ để quản dữ liệu và đưa mô hình vào vận hành; và bài toán được chọn vượt quá khả năng hiện tại của công nghệ.

Trong nhóm được phỏng vấn ở khối doanh nghiệp, 84% nhắc tới các vấn đề liên quan tới lãnh đạo (leadership-related issues) — chủ yếu ở khâu xác định và truyền đạt bài toán, chứ không phải khâu kỹ thuật.

Ba thứ hay giết pilot mà không xuất hiện trong bản demo:

Không có tiêu chí đạt. Câu hỏi "bao nhiêu phần trăm đúng thì đưa vào dùng thật" nếu không được trả lời trước khi bắt đầu thì sẽ không bao giờ được trả lời. Mỗi lần họp lại có một ý kiến khác về việc nó đã đủ tốt chưa, và dự án trôi.

Dữ liệu chưa sẵn sàng. Demo chạy trên tập dữ liệu sạch do người làm chọn ra. Sản xuất chạy trên dữ liệu thật — thiếu trường, sai định dạng, trùng lặp, viết tắt mỗi phòng một kiểu.

Chi phí không kiểm soát được. Chi phí không chỉ tăng theo số người dùng. Với agent, mỗi tác vụ còn có thể kéo theo nhiều lượt gọi mô hình, nhiều vòng lặp và lượng context khác nhau. Một pilot chạy vài trăm lượt mỗi ngày thì hoá đơn không đáng kể; đưa lên quy mô thật thì con số nhân lên theo cách ít ai tính trước.

Sơ đồ phễu từ trên xuống: DEMO CHẠY TỐT ở trên cùng, đi qua bốn cửa ải hẹp dần rồi mới tới PRODUCTION. Cửa 1 — tiêu chí đạt: bao nhiêu phần trăm đúng thì được đưa vào dùng thật. Cửa 2 — dữ liệu thật: demo chạy trên tập sạch, production chạy trên dữ liệu thiếu trường sai định dạng. Cửa 3 — điểm nối vào quy trình: đầu ra đi thẳng vào hệ thống nào hay dừng ở chỗ phải copy tay. Cửa 4 — chi phí ở quy mô thật: một tác vụ kéo theo bao nhiêu lượt gọi mô hình.

Agent washing

Có một nguyên nhân thất bại nằm ngoài tổ chức: thứ được mua về không phải thứ được quảng cáo.

Gartner đặt tên cho hiện tượng này là agent washing — nhà cung cấp gắn mác "agent" cho chatbot và công cụ tự động hoá có sẵn, không kèm theo năng lực tự chủ nào đáng kể. Mức độ phổ biến đáng chú ý: Gartner đánh giá chỉ một phần rất nhỏ trong số hàng nghìn nhà cung cấp tự nhận có giải pháp agentic là thực sự có năng lực đó.

Với người mua, hệ quả rất cụ thể. Bạn ký hợp đồng cho một hệ thống được kỳ vọng tự lập kế hoạch và tự xử lý nhiều bước, rồi phát hiện nó là một luồng kịch bản có sẵn khoác áo mới. Pilot thất bại, nhưng lý do nằm ở khâu mua chứ không ở khâu triển khai.

Cách kiểm tra không cần kỹ thuật: hỏi nhà cung cấp mô tả một tình huống mà hệ thống của họ tự quyết định phải làm gì tiếp theo trong khi không có kịch bản dựng sẵn cho tình huống đó — và yêu cầu họ cho xem log của quyết định đó.

Nhóm sống sót làm khác gì

Đây là phần quan trọng hơn phần thống kê thất bại, vì nó là phần dùng được.

MIT mô tả nhóm thiểu số thành công có mấy đặc điểm chung: giải quyết một bài toán hẹp thuộc một nghiệp vụ cụ thể thay vì làm nền tảng đa dụng; gắn thẳng vào quy trình đang chạy thay vì tồn tại như một công cụ riêng; và phần lớn nằm ở khối vận hành nội bộ chứ không phải ở các ứng dụng hào nhoáng hướng ra khách hàng. Nhóm nghiên cứu cũng ghi nhận nhiều trường hợp thành công được xây cùng đối tác hiểu nghiệp vụ, chứ không phải mua trọn gói một sản phẩm chung.

Đọc ngược lại thì đây là bốn câu hỏi tự chấm cho một pilot đang chạy:

  1. Nó giải bài toán nào, của phòng ban nào, đo bằng chỉ số nào đang có sẵn? Nếu câu trả lời là "tăng năng suất chung", pilot này chưa có tiêu chí đạt.
  2. Kết quả của nó đi vào quy trình nào? Nếu đầu ra dừng ở chỗ ai đó phải copy sang một hệ thống khác, phần tiết kiệm được sẽ mất ở đúng chỗ đó.
  3. Ai là người chịu trách nhiệm khi nó sai? Không phải để quy lỗi, mà vì nếu không ai được chỉ định thì cũng không ai có quyền quyết định đưa nó vào dùng thật.
  4. Chi phí ở quy mô thật là bao nhiêu, tính theo lượt gọi mô hình chứ không chỉ theo số người dùng? Con số này phải có trước khi mở rộng, không phải sau.
Bốn thẻ câu hỏi tự chấm, mỗi thẻ kèm một tín hiệu trượt. Một: nó giải bài toán nào, của phòng ban nào, đo bằng chỉ số nào đang có sẵn — trượt nếu câu trả lời là tăng năng suất chung. Hai: kết quả đi vào quy trình nào — trượt nếu đầu ra dừng ở chỗ phải copy sang hệ thống khác. Ba: ai chịu trách nhiệm khi nó trả lời sai — trượt nếu không ai được chỉ định. Bốn: chi phí ở quy mô thật theo lượt gọi mô hình — trượt nếu chỉ tính theo số người dùng.

Bốn câu này trả lời được trong một buổi họp. Nếu có câu nào chưa có đáp án, đó là chỗ pilot sẽ mắc lại — và biết trước thì rẻ hơn nhiều so với biết sau sáu tháng.

Điều đáng nói nhất

Điểm đáng chú ý là nhiều nút thắt quyết định thành bại lại nằm ngoài bản thân mô hình.

Model tốt hơn có thể cải thiện một phần bài toán, nhưng không tự giải quyết dữ liệu chưa sẵn sàng, tiêu chí không rõ, hệ thống cũ không kết nối được, hay việc không ai chịu trách nhiệm.

Đó cũng là tin tốt, theo một nghĩa nào đó: chúng là những thứ doanh nghiệp tự sửa được, không phải chờ ai.

KumaClouds có thể hỗ trợ rà soát một pilot AI đang chạy theo bốn câu hỏi ở trên, và chỉ ra chỗ nào sẽ mắc trước khi nó mắc.

Nguồn

  • MIT Project NANDA — The GenAI Divide: State of AI in Business 2025 (7/2025). Phương pháp: 52 phỏng vấn lãnh đạo, khảo sát 153 quản lý, phân tích 300 triển khai AI công khai. Thông tin dự án: nanda.media.mit.edu
  • RAND — The Root Causes of Failure for Artificial Intelligence Projects and How They Can Succeed: Avoiding the Anti-Patterns of AI, RRA2680-1 (2024). Phương pháp: phỏng vấn có cấu trúc 65 nhà khoa học dữ liệu và kỹ sư: rand.org/pubs/research_reports/RRA2680-1
  • Gartner — Gartner Predicts Over 40% of Agentic AI Projects Will Be Canceled by End of 2027, thông cáo báo chí 25/6/2025: gartner.com/en/newsroom