Năm khoản chi phí nhà cung cấp không ghi vào hóa đơn khi để AI chạy trọn workflow.
Ban ngày tôi điều hành đội delivery, ban đêm chạy một lab AI nhỏ, nên tôi đã xem mấy cái flow tự động này ở cự ly gần khá nhiều. Không phải bản trên keynote. Bản lúc 2 giờ sáng, khi run vẫn đang chạy, đồng hồ token vẫn leo, và không ai trong phòng nói được lúc này con agent đang thực sự làm gì.
Lời chào hàng lúc nào cũng giống nhau. Giao việc cho AI, đi chỗ khác, quay lại có kết quả hoàn chỉnh. Lời chào đó đúng với những việc hẹp và lặp lại. Nó vỡ ra ngay khi việc mang tính mở, và khoảng cách giữa hai trường hợp đó chính là thứ bị giấu đi. Nên đây là hóa đơn trung thực, từng dòng một, từ một người vẫn đang trả nó đều đặn.

Năm dòng chi phí không ai đưa lên slide. Đi từng cái một.
Một flow tự động không suy nghĩ theo từng bước như bạn. Nó lặp. Nó đọc lại context của chính mình, thử lại, tự nghi ngờ, đi vào những nhánh bạn chẳng yêu cầu. Mỗi vòng lặp là tiền token, và token là tiền thật.
Cái đau không nằm ở con số hóa đơn. Nó nằm ở chỗ hóa đơn to không mua được sự bảo đảm nào. Tôi có những run đốt bằng cả một buổi làm việc dài, rồi ra một thứ phải vứt đi. Bạn trả tiền cho phần suy nghĩ, và vẫn ôm nguyên bài toán.
Trước khi tự động hóa bất cứ việc mở nào, hãy đặt một con số lên đó. Đặt trần chi phí mỗi run. Theo dõi 10 run đầu tiên và ghi lại từng run tốn bao nhiêu và có thực sự ra sản phẩm dùng được không. Nếu phần lớn tiền chảy vào những run bạn vứt đi, cái flow đó chẳng tiết kiệm gì cho bạn, nó chỉ chuyển chi phí từ giờ công của bạn sang cái thẻ của bạn.
Khi một con người làm việc, bạn hỏi được họ đang ở đâu. Một con agent tự động trả cho bạn một mớ output và một kết quả, còn phần suy luận ở giữa thì gần như mù. Bạn thấy nó quyết gì, không thấy vì sao.
Cái mù đó không sao cho tới lúc output sai. Lúc đó bạn đang debug một hộp đen. Bạn không đặt được breakpoint lên một linh cảm. Thường thì cách nhanh nhất là bỏ cả run rồi làm lại từ đầu với một chỉ dẫn chặt hơn, nghĩa là cái "tự động hóa" vừa bắt bạn làm lại toàn bộ.

Con người thì bạn hỏi được đang kẹt ở đâu. Với agent, bạn nhận kết quả rồi phải tự dò ngược lại đường đi.
Thứ bạn đánh mất ở đây mới là chi phí thật, không phải tiền tính toán. Một workflow bạn không soi được giữa chừng là một workflow bạn không sửa được giữa chừng. Hoặc bạn tin nó nhắm mắt, hoặc bạn chờ tới cuối rồi cầu may.
Bảo agent làm một thứ đơn giản, nó hay trả cho bạn một thứ phức tạp. Một script nhỏ thành một framework. Một sửa đổi một dòng thành một cuộc refactor với ba lớp trừu tượng mới bạn chẳng xin, và giờ phải nuôi.
Chuyện này xảy ra vì model đã thấy rất nhiều code "kỹ lưỡng", và với nó, kỹ lưỡng trông giống như nhiều hơn. Nó chạy theo cái vẻ hoàn chỉnh. Để mặc, nó xây nhà thờ lớn trong khi bạn chỉ cần một cái lán.
Chi phí rơi xuống về sau, khi có người phải đọc, sửa, hoặc tin vào đoạn code đó. Output over-engineer thì review chậm hơn và dễ vỡ hơn. Nếu bạn không phản ứng mạnh và đòi bản đơn giản nhất, cái flow lặng lẽ đổi thời gian bảo trì tương lai của bạn lấy cái vẻ chăm chỉ của hôm nay.
Model nào cũng bịa. Một API không tồn tại, một con số sai nói chắc nịch, một trích dẫn không có thật. Trong chat bạn bắt được vì đang đọc từng dòng. Trong flow tự động, cái dữ kiện bịa đó trở thành đầu vào cho bước sau, rồi bước sau nữa, trước khi bạn kịp nhìn thấy.
Phần tệ nhất là đây. Khi nó xảy ra, bạn thường không có cách nào sạch để kiểm soát. Bạn không bảo model "đừng sai chỗ này nữa" một cách đáng tin được, vì nó đâu biết nó sai. Lỗi được giặt sạch qua 10 bước nói chắc nịch rồi tới tay bạn dưới dạng một kết quả hoàn chỉnh.

Một dữ kiện bịa ở đầu flow không nằm yên một lỗi. Nó thành mặt đất cho mọi bước sau đứng lên.
Đó là lý do tôi tin một flow tự động ít nhất ở đúng những việc quan trọng nhất: bất cứ việc gì có dữ kiện thật, con số thật phía sau. Cái flow nguy hiểm nhất đúng ngay chỗ sai là tốn kém nhất.
Tôi dùng mấy công cụ này mỗi ngày và nói thẳng: tự động hóa workflow trọn vẹn vẫn là một bản thử nghiệm. Coi nó như một sản phẩm hoàn chỉnh là cái sai. Nó mạnh trong tay người biết khi nào nó nói dối và biết cách quây nó lại. Nó là cái bẫy cho bất kỳ ai nhận output theo mệnh giá.
Đó là ranh giới nhà cung cấp làm mờ đi. Demo ngụ ý "ai cũng làm được". Thực tế gần hơn với "một chuyên gia giám sát được việc này". Nếu bạn chưa phải chuyên gia, việc tự động một flow từ đầu đến cuối vẫn cần cái chuyên môn đó. Nó chỉ nằm im cho tới khi có thứ vỡ ra, và lúc đó nó là cả vấn đề.
Cách chữa phổ biến cho tất cả những thứ trên là hội đồng multi-agent. Chạy vài agent trên cùng một flow, cho chúng kiểm tra chéo nhau, để sự bất đồng bắt lỗi. Grok đang áp dụng một phiên bản của cách này. Trên giấy thì đó là một hội đồng fact-check.
Tôi đã thử. Chỗ kẹt là: mấy con agent đó thường dùng chung một model nền. Nên khi model sai, mọi agent sai y một kiểu. Chúng đồng thuận trên cái lỗi rồi đưa lại cho bạn với sự tự tin cao hơn. Cái hội đồng không bắt được lỗi vì mọi thành viên chung một điểm mù.

Năm người duyệt, một bộ não. Chúng không kiểm tra chéo cái lỗi, chúng cùng ký tên vào nó.
Kiểm tra chéo thật cần sự độc lập. Các model khác nhau, huấn luyện khác nhau, sai khác nhau, để con này bắt được cái con kia bỏ sót. Và đây mới là chỗ khó. Trộn model của nhiều nhà khác nhau trong một flow đâm thẳng vào ranh giới bảo mật, quy tắc chia sẻ dữ liệu, độ trễ, chi phí, và cả đống việc tích hợp mà phần lớn team sẽ không gánh. Phiên bản multi-agent trung thực thì đắt và hiếm. Phiên bản rẻ, cùng một model đội năm cái mũ, cho bạn cảm giác được review mà không có chút bảo vệ nào.
Cửa sổ context là hữu hạn. Nhồi cho model nhiều hơn sức nó giữ, nó bắt đầu rơi hoặc làm mờ phần trước đó. Việc nhỏ thì bạn chẳng bao giờ chạm tường. Việc lớn, ghép nhiều phiên lại với nhau, bạn chạm tường liên tục, và đó là chỗ ảo giác sinh sôi. Model quên một ràng buộc từ ba bước trước rồi tự tin bịa ra một cái thay thế.
Dự án càng lớn, càng trải qua nhiều phiên làm việc, thứ này càng dồn lên. Chưa có hệ thống bộ nhớ nào trên thị trường hôm nay giải được trọn vẹn. Có những mẹo khôn ngoan, retrieval, tóm tắt, scratchpad, nhưng không cái nào cho model một bộ nhớ hoàn hảo và bền về mọi thứ đã đến trước. Nên tỉ lệ lỗi không nằm phẳng khi bạn mở rộng quy mô. Nó leo lên.

Mỗi phiên mới đẩy context cũ về phía mép cửa sổ. Tỉ lệ lỗi không giữ nguyên khi bạn scale, nó tăng lên.
Ghép tất cả lại, bạn rơi vào đúng chỗ mà những người có kinh nghiệm đã đứng sẵn. Cách hiệu quả nhất hôm nay là một con người cầm cương và điều chỉnh, còn AI làm phần nặng bên trong những ranh giới mà con người đặt ra và kiểm tra.
Đó là cách bạn lấy được tốc độ mà không thừa hưởng đống lỗi đi kèm. Con người chia việc nhỏ đủ để kiểm chứng được, review tại các chốt giữa chừng thay vì chỉ ở cuối, bắt cái ảo giác trước khi nó lan, và giết cái over-engineering trước khi nó kịp ship. AI chạy nhanh. Con người quyết cái gì là đúng và cái gì là xong.

Mẫu hình chạy được. AI làm việc, con người giữ ranh giới, giữ các chốt, và giữ quyền quyết cái gì là đúng.
Để AI lo tuyệt đối mọi thứ nghe thì hiệu quả và đọc lên rất xuôi trong một bộ slide gọi vốn. Trên thực tế đó là cách bạn ship sự vô nghĩa đầy tự tin ở quy mô lớn. Những team lấy được giá trị thật coi model như một bộ phận mạnh bên trong một quy trình do con người điều hành, và không bao giờ coi nó là cả cái quy trình.
Các công ty bán sự tiện lợi của tự động hóa và im lặng về phần còn lại. Nvidia với Microsoft công bố một con laptop AI với những tính năng nghe như trên trời, còn các điều kiện kèm theo thì nằm dưới chân trang. Cùng một hình dáng đó xuất hiện trong những workflow tự động bóng bẩy mà chính các lab AI đem ra demo. Năng lực là thật. Cách đóng gói thì bỏ ra ngoài chi phí, các kiểu lỗi, và cái chuyên môn cần có để chạy nó an toàn.
Người dùng cuối bước đi với ấn tượng rằng công cụ làm được nhiều hơn, và làm đáng tin hơn, so với thực tế. Đó không phải chuyện nhỏ. Nó đặt người ta vào thế giao việc thật cho một hệ thống họ không hiểu, rồi ngạc nhiên khi nó vỡ đúng theo những cách mà người dựng ra nó lẽ ra đã cảnh báo được.
Nếu bạn đang dùng hoặc đang cân nhắc một flow AI tự động, bạn không cần vứt nó đi. Bạn cần chạy nó như một người lớn.

Kỷ luật năm phút biến một flow tự động từ canh bạc thành công cụ.
Đặt trần token mỗi run và theo dõi những run đầu thực sự tốn bao nhiêu so với thứ chúng ship ra. Chia mỗi việc nhỏ đủ để bạn kiểm chứng kết quả bằng tay. Cắm các chốt review vào giữa flow, không chỉ ở cuối, để bạn sửa được trước khi một bước sai đầu độc phần còn lại.
Coi mọi dữ kiện, con số, trích dẫn mà flow tạo ra là chưa kiểm chứng cho tới khi tự bạn soi lại, nhất là với bất cứ thứ gì mang hậu quả thật. Và khi output trông phức tạp hơn bài toán của bạn, trả nó về và đòi bản đơn giản nhất mà chạy được.
Chẳng có cái nào trong đó hào nhoáng cả. Đó là cái kỷ luật không hào nhoáng quyết định AI tiết kiệm thời gian cho bạn hay lặng lẽ ngốn nhiều hơn nó cho. Model đang tốt lên rất nhanh. Còn cái phán đoán khi nào nên tin nó, và khi nào nên giữ tay trên cương, vẫn là thứ bạn phải tự cấp.
1 đến 2 email mỗi tháng. Hủy đăng ký dễ.
1 đến 2 email mỗi tháng. Hủy đăng ký dễ.
Bình luận