Hàng trăm câu lệnh đã dạy chúng tôi điều gì về AI hội thoại

Hàng trăm câu lệnh phục vụ khách hàng cho thấy cách các tác nhân AI có thể giao tiếp nhất quán, luôn hữu ích và thể hiện tiếng nói chung của thương hiệu.

Tóm tắt tổng quan

  • AI tiếp xúc trực tiếp với khách hàng đại diện cho thương hiệu của bạn, nên cách xây dựng nó hoàn toàn khác với công cụ nội bộ.

  • Sự khác biệt giữa một tác nhân hoạt động được và một tác nhân có sức thuyết phục nằm ở tư duy nhiều hơn là kỹ thuật, bởi hầu hết câu lệnh được viết như tập hợp chỉ dẫn chứ không phải thiết kế cho cuộc đối thoại.

  • Ngôn ngữ học và tâm lý học nhận thức mang đến một góc nhìn tốt hơn: hội thoại có cấu trúc, còn câu lệnh tạo ra một môi trường định hướng sự chú ý. Nội dung bạn đặt ở đầu, lặp lại và dùng để kết thúc đều sẽ định hình hành vi của tác nhân một cách ổn định.

  • Các ràng buộc có ích, nhưng chỉ khi đủ chính xác. Quá nhiều trường hợp ngoại lệ sẽ khiến tương tác thiếu tự nhiên và câu lệnh cồng kềnh; giảm số quyết định cần đưa ra giúp tập trung vào những quyết định quan trọng hơn.

Xây dựng AI hội thoại trực tiếp phục vụ khách hàng là một thách thức lớn đối với doanh nghiệp.

Ngay cả với những doanh nghiệp tiên phong ứng dụng công nghệ, đã đưa AI vào cộng tác ở cấp độ từng nhân viên và thậm chí phát triển công cụ AI tùy chỉnh để dùng nội bộ, việc đưa AI ra làm giao diện kết nối doanh nghiệp với thế giới vẫn là một câu chuyện hoàn toàn khác.

Và đó thực sự là một lần “thăng chức”. Khi trực tiếp phục vụ khách hàng, AI từ một thực tập sinh chăm chỉ trở thành nhân viên chính thức, khoác đồng phục và đại diện cho thương hiệu trước khách hàng.

Rủi ro rất lớn. Mỗi sai sót giờ đây đều diễn ra công khai và có thể bị ghi lại.

Các sản phẩm chúng tôi xây dựng thường là hệ thống đa tác nhân, với những tương tác phức tạp ở cấp độ nghiệp vụ. Tuy nhiên, phần logic đó đôi khi lại dễ hơn. Thách thức lớn hơn là khiến người dùng tin rằng họ vẫn đang trò chuyện với cùng một tác nhân từ đầu đến cuối và những điều tác nhân nói thực sự có giá trị.

Vì vậy, chúng tôi viết đi viết lại câu lệnh hết lần này đến lần khác.

Có những tác nhân chỉ thành hình sau hàng trăm lần chỉnh sửa câu lệnh. Tất cả đều hướng đến cùng một mục tiêu: bám sát nhiệm vụ và sử dụng giọng điệu tạo được sự đồng cảm với người dùng.

Kinh nghiệm tinh chỉnh câu lệnh đã thôi thúc chúng tôi tìm kiếm cảm hứng theo những cách sáng tạo hơn. Chúng tôi bắt đầu vay mượn ý tưởng từ các lĩnh vực khác. Dĩ nhiên, không phải cách nào cũng hiệu quả; còn những cách hiệu quả thì hiếm khi thành công ngay lần đầu. Những thử nghiệm này đã dần hình thành trong đội ngũ chúng tôi một mô thức xây dựng câu lệnh khác biệt.

Góc nhìn về câu lệnh từ ngôn ngữ học và tâm lý học nhận thức

Khoảng cách giữa một tác nhân vận hành bài bản và một tác nhân trò chuyện xuất sắc không thuần túy nằm ở kỹ thuật mà còn ở tư duy. Đó là khoảng cách giữa thế giới bạn đặt tác nhân vào qua câu lệnh và thế giới giao tiếp thực tế của con người, nơi tác nhân hoạt động.

Thế giới thứ hai vốn đầy mơ hồ. Con người rất nhạy bén với điều đó và những người thiện chí giao tiếp sẽ cùng nhau điều hướng bằng một loạt quy tắc hội thoại tinh tế, bất thành văn. Một tác nhân thiếu chuẩn bị sẽ dễ dàng bị nhận ra.

Để duy trì “bức tường thứ tư”, hay ảo giác Turing, chúng ta có thể giúp tác nhân nắm vững nghệ thuật đối thoại bằng những hiểu biết từ ngôn ngữ học và tâm lý học nhận thức.

Ngôn ngữ học có cả một bộ công cụ để nghiên cứu ngôn ngữ trong thực tiễn, bao gồm Phân tích hội thoại, lĩnh vực xem xét cách con người tổ chức và điều phối cuộc trò chuyện qua từng khoảnh khắc. Khi áp dụng vào việc xây dựng câu lệnh, khuôn khổ này cho chúng ta hệ thuật ngữ để nhìn nhận hội thoại không phải như sự trao đổi lời nói, mà là sự trao đổi hành động.

Một số hành động mang tính thực tiễn, như hỏi hoặc cung cấp thông tin; số khác mang tính xã hội, như duy trì quan hệ hoặc tránh gây căng thẳng. Những bước tương tác này diễn ra trong cấu trúc rộng hơn của cuộc đối thoại và các giai đoạn của nó, mỗi giai đoạn đều có những hành động được mong đợi. Đối thoại có phần mở đầu và kết thúc, nhưng cũng có những lần chuyển chủ đề và cả bước chuẩn bị chuyển chủ đề—những khoảnh khắc đôi khi gượng gạo khi một hướng đi mới được khéo léo đề xuất, thương lượng và ngầm thống nhất.

Hiểu lầm luôn có thể xảy ra, ngay cả khi tất cả các bên đều có thiện chí. Dù mỗi người thành thạo nghệ thuật đối thoại ở mức độ khác nhau, điều quan trọng là LLM đứng sau tác nhân của bạn không được trang bị sẵn trực giác mà ngay cả một người giao tiếp bình thường cũng có.

Cách tận dụng sự chú ý để đạt được sự rõ ràng trong khuôn khổ

Bên cạnh phân tích ngôn ngữ học, tâm lý học nhận thức mang đến một góc nhìn bổ trợ. Lĩnh vực này cho chúng ta biết sự chú ý, trí nhớ và quá trình ra quyết định thực sự vận hành ra sao—con người coi trọng nội dung ở đầu và cuối khác nhau thế nào, các tác nhân kích hoạt cụ thể tạo ra hành vi ổn định ra sao, và cách ràng buộc có thể giải phóng tư duy nhờ giảm tải nhận thức.

Câu lệnh không phải là vật chứa trung tính cho các chỉ dẫn. Đó là một môi trường định hướng sự chú ý. Vì vậy, nội dung ở đầu rất quan trọng. Nội dung ở cuối cũng quan trọng. Nội dung được lặp lại cũng quan trọng. Khi đọc một danh sách, con người thường dễ nhớ phần đầu và phần cuối hơn phần giữa. Các nhà tâm lý học gọi đây là hiệu ứng vị trí chuỗi: hiệu ứng ưu tiên phần đầu và phần gần nhất.

Trong thực tế, chúng tôi nhận thấy điều tương tự ở các LLM. Hướng dẫn ở phần đầu thiết lập bối cảnh: tác nhân là ai, đảm nhiệm vai trò gì và dự kiến sẽ gặp một thế giới như thế nào. Hướng dẫn kết thúc thường có tác dụng như “điều cuối cùng tác nhân nghe thấy”. Nếu đặt những chỉ dẫn quan trọng nhất ở đó, khả năng chúng được thực hiện sẽ cao hơn.

Bên cạnh việc cân nhắc kỹ vị trí của từng chỉ dẫn trong câu lệnh, chúng ta cũng nên theo dõi hình dạng tổng thể của ranh giới mà các chỉ dẫn ấy đang tạo ra cho tác nhân.

Các chỉ dẫn đóng vai trò ràng buộc tác nhân, giảm số khả năng cạnh tranh mà tác nhân phải cân nhắc và thu hẹp không gian vấn đề tổng thể. Câu lệnh cần có đủ ràng buộc để nhiệm vụ của tác nhân nằm trong khả năng xử lý.

Khi hướng dẫn nhân viên, đặc biệt là người ít kinh nghiệm, tâm lý học cho thấy chúng ta nên làm rõ nhiệm vụ cần thực hiện để giảm tải nhận thức tối đa. Ràng buộc có thể khiến ta cảm thấy mất tự do, nhưng việc giảm số quyết định cần đưa ra lại giúp ta tập trung vào vài quyết định quan trọng còn lại và sáng tạo khi hành động trong giới hạn.

Ngược lại, cố gắng khiến tác nhân không phải đưa ra bất kỳ quyết định nào bằng cách dùng danh sách hành vi mẫu để bao quát mọi trường hợp ngoại lệ có thể hình dung là cách hiệu quả để tạo ra một đối tác trò chuyện gượng gạo, chưa kể một câu lệnh Frankenstein cồng kềnh với vô số điều kiện nếu–thì, cực kỳ khó quản lý.

(Chúng tôi đang nói đến kỹ thuật ít mẫu đấy.)

Một câu lệnh có ranh giới hợp lý sẽ định hướng đủ rõ ràng mà không làm yêu cầu trở nên quá tải hay khiến tác nhân tê liệt. Điều này thường có nghĩa là đưa ra ít trường hợp ngoại lệ hoặc mục tiêu hơn cho tác nhân, cả về nội dung nên hay không nên nói lẫn cách nên hay không nên diễn đạt.

Câu lệnh ít mẫu so với câu lệnh dựa trên ranh giới

Sơ đồ minh họa cách xây dựng câu lệnh ít mẫu so với dựa trên ranh giới.

Theo kinh nghiệm của chúng tôi, nếu bạn phải dùng câu lệnh ít mẫu để điều chỉnh ranh giới thì ranh giới đó chưa đủ chính xác. Hãy quay lại các chỉ dẫn cốt lõi và tinh chỉnh chúng.

Thiết kế điều kiện cho cuộc đối thoại hiệu quả hơn

Từ góc độ tâm lý học nhận thức, chúng tôi đã xem xét vị trí nên đặt từng chỉ dẫn trong câu lệnh, đồng thời cân nhắc cả số lượng lẫn chất lượng chỉ dẫn cần thiết để xác lập ranh giới tối ưu cho không gian vấn đề của tác nhân.

Nhìn lại những nhận định trước đó về nghệ thuật đối thoại dưới góc độ ngôn ngữ học, chúng ta có thể hoàn thiện mô thức xây dựng câu lệnh bằng cách xem chỉ dẫn hướng đến đối thoại là một phần trong ranh giới nhiệm vụ rộng hơn của tác nhân.

Với AI trực tiếp phục vụ khách hàng, đối thoại luôn là siêu nhiệm vụ, dù chúng ta có thừa nhận hay không. Khi chủ động đề cập đến đối thoại trong câu lệnh, chúng ta chấp nhận dành một phần năng lực xử lý, hay “tải nhận thức”, của tác nhân cho việc nhận biết và phản hồi trong đối thoại nhằm cải thiện khả năng trò chuyện.

Tuy nhiên, sự đánh đổi là chúng ta có thể phải thu hẹp nhiệm vụ chính để duy trì một không gian vấn đề tổng thể dễ xử lý và có ranh giới rõ ràng.

Vì vậy, với AI trực tiếp phục vụ khách hàng, chúng ta cần thiết kế toàn diện các điều kiện để cải thiện cả đối thoại lẫn quyết định. Chúng tôi hướng đến những tác nhân nhỏ gọn, có ranh giới rõ ràng, với nhiệm vụ chính được đặt trong bối cảnh hoặc bao hàm siêu nhiệm vụ đối thoại. Chúng tôi không viết hàng đống chỉ dẫn rồi tinh chỉnh chúng qua các ví dụ. Chúng tôi viết một tập hợp chỉ dẫn ngắn gọn, được trau chuốt đủ chính xác để không còn cần đến ví dụ.

Đây là mô thức xây dựng câu lệnh mà chúng tôi dùng để tạo ra các tác nhân không chỉ bám sát nhiệm vụ mà còn thực hiện nhiệm vụ với phong thái trò chuyện tinh tế.

Sau khi đã phác họa bức tranh khái niệm, trong bài blog tiếp theo, chúng tôi sẽ đi sâu hơn vào thực tiễn. Chúng ta sẽ xem xét một số mô thức chủ chốt hình thành khi chúng tôi áp dụng các nguyên tắc này vào câu lệnh qua quá trình thử nghiệm thực tế. Điều thú vị là các nhà cung cấp mô hình tiên phong cũng bắt đầu đưa những mô thức tương tự vào hướng dẫn xây dựng câu lệnh của họ. Hẹn bạn ở bài tiếp theo.

Tác giả

Douglas Smith, Sam Netherwood