Tóm Tắt Khoa Học (Abstract)
ICLR 2023 Chuẩn Học ThuậtMặc dù các mô hình ngôn ngữ lớn (Large Language Models - LLMs) đã thể hiện hiệu năng ấn tượng trên nhiều tác vụ hiểu ngôn ngữ và ra quyết định tương tác, khả năng suy luận (reasoning) (ví dụ: kích hoạt chuỗi suy nghĩ - chain-of-thought prompting) và hành động (acting) (ví dụ: tạo kế hoạch hành động - action plan generation) của chúng phần lớn vẫn được nghiên cứu như các chủ đề tách biệt.
Trong bài báo này, chúng tôi khám phá việc sử dụng LLMs để tạo ra đồng thời cả vết suy luận (reasoning traces) và các hành động đặc thù cho tác vụ (task-specific actions) theo cơ chế xen kẽ (interleaved manner), mang lại sự hiệp đồng (synergy) lớn hơn giữa cả hai:
Chúng tôi áp dụng phương pháp tiếp cận này, đặt tên là ReAct, vào một tập hợp đa dạng các tác vụ ngôn ngữ và ra quyết định, chứng minh tính hiệu quả vượt trội của nó so với các đường cơ sở tiên tiến nhất (state-of-the-art baselines), bên cạnh việc nâng cao khả năng diễn giải (interpretability) và độ tin cậy (trustworthiness) đối với con người.
Cụ thể:
- Trên các tác vụ trả lời câu hỏi nhiều bước (HotpotQA) và xác minh sự thật (FEVER), ReAct khắc phục triệt để các vấn đề phổ biến về ảo giác (hallucination) và sự lan truyền lỗi (error propagation) trong suy luận chain-of-thought thông qua việc tương tác với một Wikipedia API đơn giản, tạo ra các quỹ đạo giải quyết tác vụ giống con người và dễ diễn giải hơn so với các đường cơ sở không có vết suy luận.
- Trên hai bộ chuẩn ra quyết định tương tác (ALFWorld và WebShop), ReAct vượt trội hơn các phương pháp học bắt chước (imitation learning) và học tăng cường (reinforcement learning) với tỷ lệ thành công tuyệt đối cao hơn lần lượt là 34% và 10%, trong khi chỉ cần được nhắc (prompted) bằng một hoặc hai ví dụ ngữ cảnh (in-context examples).
Bối Cảnh Thực Tiễn & Động Lực Nhận Thức (Cognitive Motivation)
Một đặc tính độc đáo của trí tuệ con người là khả năng kết hợp liền mạch các hành động định hướng mục tiêu (task-oriented actions) với suy luận bằng ngôn ngữ (verbal reasoning hoặc inner speech). Cơ chế này được các nhà tâm lý học nhận thức nổi tiếng như Vygotsky (1987), Luria (1965) và Baddeley (1992) chứng minh là chìa khóa duy trì bộ nhớ làm việc (working memory), lập chiến lược và tự sửa sai khi môi trường có biến động.
Hạn Chế của Chain-of-Thought (CoT) — "Chỉ Suy Nghĩ"
CoT là một hệ thống khép kín (closed-loop nội tại): mô hình chỉ tự sinh suy nghĩ từ tri thức tĩnh đã huấn luyện mà không thể tiếp xúc với môi trường bên ngoài để cập nhật dữ kiện mới. Điều này dẫn tới ảo giác nghiêm trọng (hallucination) và lỗi suy luận lan truyền không thể cứu vãn.
Hạn Chế của Act-Only — "Chỉ Hành Động"
Các mô hình hành động thuần túy (như phong cách WebGPT hay policy RL) chuyển mục tiêu thành chuỗi thao tác vật lý/API nhưng thiếu đi bộ đệm suy luận trừu tượng. Khi quan sát trả về kết quả rác hoặc không như kỳ vọng, mô hình bị mất định hướng, không thể phân rã mục tiêu lớn hay tự hồi phục.
Giải Pháp Đột Phá ReAct (Reasoning + Acting)
ReAct thiết lập một giao thức luân phiên: Thought $\rightarrow$ Action $\rightarrow$ Observation $\rightarrow$ Thought $\rightarrow \dots$. Vết suy luận giúp cập nhật kế hoạch hành động và xử lý ngoại lệ; trong khi hành động giúp tương tác với cơ sở dữ liệu, API hoặc môi trường ngoài để tiếp nhận sự kiện tiếp đất (grounded facts), xóa bỏ hoàn toàn nguy cơ bịa đặt thông tin.
So Sánh 4 Mẫu Hình Prompting Trong LLM
Bài báo ReAct phân định rõ ràng sự tiến hóa nhận thức của LLM qua 4 phương pháp kích hoạt câu nhắc:
Standard Prompting
Chỉ có Câu hỏi và Câu trả lời trực tiếp.
• Hiệu năng thấp nhất ở bài toán phức tạp
Chain-of-Thought (CoT)
Reason-Only (Chỉ suy luận nội tâm).
• Bị ảo giác và lỗi tích tụ (56%)
Act-Only
Action-Only (Chỉ gọi API/Môi trường).
• Thiếu trí nhớ làm việc & dễ lạc lối
ReAct (Ours)
Reason + Act Xen Kẽ Nhịp Nhàng.
• Tự sửa sai khi công cụ lỗi
Sơ đồ Chu Trình Nhận Thức - Hành Động ReAct
Phân rã mục tiêu, tổng hợp Obs,
hoạch định bước kế tiếp"] A["Action t (Hành động):
search[entity], lookup[key],
hoặc finish[answer]"] end subgraph Environment ["Môi Trường Ngoại Tại (World / API)"] W["Wikipedia API / SQL DB /
Hệ Thống Nhà Hàng / Web"] O["Observation t (Quan sát):
Dữ liệu thực tế tiếp đất (Grounding)"] end Q --> T H --> T T --> A A -->|Gửi lệnh thực thi| W W -->|Trả về kết quả| O O -->|Cập nhật vào Context| H T -.->|Hoàn thành nhiệm vụ| FINISH["Kết quả Cuối cùng (Answer)"] style Cognitive fill:#f0fdf4,stroke:#22c55e,stroke-width:2px; style Environment fill:#eff6ff,stroke:#3b82f6,stroke-width:2px; style Context fill:#f8fafc,stroke:#94a3b8,stroke-width:1px;
Thiết Lập Toán Học & Không Gian Hành Động ReAct (Công Thức Chuẩn & Dễ Hiểu)
Tổng hợp đầy đủ 7 công thức chuẩn từ Section 2 bài báo gốc của Yao et al. (ICLR 2023) kèm diễn giải trực quan, dễ hiểu
3.1 Trực Giác Ban Đầu: Con Người Vừa "Nghĩ" Vừa "Làm" Như Thế Nào?
Hãy tưởng tượng bạn đang vào bếp chuẩn bị bữa tối:
"Mình cần 2 quả trứng. Mở tủ lạnh kiểm tra xem còn không... Ồ hết trứng rồi, vậy giờ phải đổi sang nấu món khác hay đi mua?"
Mở cánh cửa tủ lạnh, nhìn vào khay trứng... Mỗi hành động mang lại một kết quả thực tế để bạn nhìn thấy và suy nghĩ tiếp.
3.2 Hệ Thống 7 Công Thức Chuẩn Trong Bài Báo & Diễn Giải Trực Quan
Tài liệu chuẩn ICLR 2023Giải thích dễ hiểu: Đây là "cuốn sổ tay ghi nhớ" của tác tử. Tại mỗi bước $t$:
- $x$ là yêu cầu hoặc câu hỏi ban đầu của người dùng (Task Input).
- $a_\tau$ là hành động tác tử đã thực hiện tại bước $\tau$ (Action).
- $o_\tau$ là kết quả môi trường hoặc công cụ trả về sau hành động đó (Observation).
- $\Rightarrow$ Toàn bộ chuỗi này gộp lại thành $c_t$, giúp mô hình không bị "quên" những gì mình vừa làm và vừa thấy.
Giải thích dễ hiểu: Dựa vào sổ tay $c_t$, mô hình quyết định chọn một hành động ngoài đời $a_t \in \mathcal{A}$ (ví dụ: bấm nút tra cứu, gọi API).
⚠️ Nhược điểm: Tác tử "chỉ biết làm mà không biết nghĩ". Vì không có suy nghĩ trong đầu để lập kế hoạch, tác tử rất dễ bị lạc hướng hoặc kẹt vòng lặp khi gặp câu hỏi nhiều chặng.
Giải thích dễ hiểu: Mô hình tự sinh ra một chuỗi suy nghĩ $\tau$ trong đầu (gồm các bước $\hat{a}_1, \hat{a}_2, \dots$) để giải bài toán.
⚠️ Nhược điểm: Môi trường bị đóng băng hoàn toàn ($o_t = \emptyset$). Mô hình hoàn toàn không tương tác với thế giới thực, chỉ tự nhớ lại tri thức cũ nên tỷ lệ ảo giác (bịa đặt thông tin) lên tới 56%.
Giải thích dễ hiểu: Ý tưởng thiên tài của bài báo nằm ở dấu hợp ($\cup$) này:
ReAct mở rộng không gian lựa chọn của AI, cho phép AI được quyền chọn 1 trong 2 loại hành động:
- Hành động ngoại tại $a \in \mathcal{A}$: Là gọi công cụ bên ngoài (Search, Lookup, Finish) để tương tác thế giới thực.
- Suy nghĩ nội tâm $\hat{a} \in \mathcal{L}$: Là lời tự nhủ bằng ngôn ngữ tự nhiên (Thought) để lập kế hoạch, chắt lọc tri thức hoặc tự sửa sai.
Giải thích dễ hiểu: Không cần huấn luyện lại mô hình khổng lồ (trọng số $\theta$ được đóng băng như PaLM-540B). Nhóm tác giả chỉ cần cung cấp một tập $\mathcal{D}_{\text{prompt}}$ gồm $k=6$ đến $8$ bài mẫu viết tay minh họa chuỗi:
LLM dựa vào các mẫu này (In-context learning) để tự động bắt chước và suy luận theo đúng phong cách ReAct.
Giải thích dễ hiểu: Nhóm tác giả lấy 3.000 lời giải mẫu ReAct thành công do mô hình lớn (PaLM-540B) giải được để huấn luyện lại (fine-tune) cho mô hình nhỏ hơn (như PaLM-8B hoặc 62B). Kết quả kinh ngạc:
🚀 Mô hình nhỏ 8B được fine-tune ReAct có hiệu năng vượt trội cả mô hình lớn 62B chỉ dùng Prompting thông thường!
3.3 3 Việc Cụ Thể Mà "Suy Nghĩ" Giúp AI Hoàn Thành Xuất Sắc Nhiệm Vụ
Chia Nhỏ Bài Toán Khó
Gặp câu hỏi phức tạp nhiều chặng, AI không bị rối. Suy nghĩ giúp phân rã mục tiêu: "Bước 1 tìm A, bước 2 tìm B, bước 3 so sánh".
Chắt Lọc Thông Tin Quan Trọng
Công cụ tìm kiếm trả về một đoạn văn dài cả nghìn từ. Suy nghĩ giúp nhặt đúng chi tiết mấu chốt và ghi vào trí nhớ làm việc.
Tự Phát Hiện Lỗi & Đổi Chiến Lược
Nếu tìm kiếm không ra kết quả (hoặc web báo lỗi), AI không bị đứng hình lặp lại vô tận, mà tự suy nghĩ đổi từ khóa thay thế.
3.4 Bảng So Sánh Tổng Hợp: Act-Only vs CoT vs ReAct
| Tiêu chí so sánh | Act-only (Chỉ làm) | CoT (Chỉ suy nghĩ) | ReAct (Vừa nghĩ vừa làm) |
|---|---|---|---|
| Không gian hành động | $\mathcal{A}$ (Chỉ công cụ ngoài) | $\mathcal{L}$ (Chỉ ngôn ngữ nội tâm) | $\hat{\mathcal{A}} = \mathcal{A} \cup \mathcal{L}$ (Cả hai) |
| Tương tác với môi trường | Có (liên tục gọi API) | Không ($o = \emptyset$, thế giới đóng băng) | Có (gọi API khi cần thiết) |
| Tỷ lệ ảo giác (Bịa đặt) | Thấp nhưng hay làm sai tác vụ | Rất cao (56% ảo giác) | Tuyệt đối an toàn (0% ảo giác) |
| Khả năng tự sửa lỗi | Kém (dễ kẹt vòng lặp) | Không (không biết mình sai) | Rất tốt (tự đổi chiến lược qua Thought) |
| Cách triển khai thực tế | Cần huấn luyện hoặc prompt | Prompt chuỗi tư duy | Rất đơn giản: Chỉ cần 6–8 ví dụ mẫu (Few-shot Prompting) |
Thực Nghiệm 1: Tác Vụ Suy Luận Thâm Dụng Tri Thức (HotpotQA & FEVER)
Các tác giả kiểm thử trên thiết lập Question-Only: mô hình chỉ nhận câu hỏi hoặc nhận định mà không có sẵn văn bản vàng. Mô hình phải tự dùng 3 API Wikipedia tối giản:
Bảng 1: Kết Quả Prompting Của PaLM-540B trên HotpotQA và FEVER
| Phương Pháp (Prompt Method) | HotpotQA (Exact Match - EM %) | FEVER (Accuracy - Acc %) | Đặc Tính Vận Hành |
|---|---|---|---|
| Standard Prompting | 28.7 | 57.1 | Mô hình hộp đen, sinh thẳng kết quả |
| Chain-of-Thought (CoT) | 29.4 | 56.3 | Chỉ suy luận tĩnh, ảo giác dữ kiện nặng |
| CoT with Self-Consistency (CoT-SC) | 33.4 | 60.4 | Lấy mẫu 21 đường CoT rồi biểu quyết đa số |
| Act-Only | 25.7 | 58.9 | Chỉ search/lookup, không có suy nghĩ nội tâm |
| ReAct (Phương pháp Đề xuất) | 27.4 | 60.9 | Vết suy luận chính xác tuyệt đối, không ảo giác |
| CoT-SC → ReAct (Chuyển tiếp khi thiếu tự tin) | 34.2 | 64.6 | Nếu CoT-SC phân vân (<50% đồng thuận) thì gọi ReAct tra cứu ngoài |
| ReAct → CoT-SC (Dung hợp tối ưu) | 35.1 | 62.0 | ReAct tra cứu ngoài trước; nếu quá số bước quy định thì dùng CoT-SC |
Phát Hiện Đột Phá Về Tinh Chỉnh Mô Hình Nhỏ (Fine-Tuning Scaling Effect)
Nhóm nghiên cứu thu thập 3.000 quỹ đạo ReAct thành công từ PaLM-540B để fine-tune các mô hình nhỏ hơn:
Phân Tích Chế Độ Lỗi: Triệt Tiêu Hoàn Toàn Ảo Giác (0% Hallucination)
Nhóm tác giả tiến hành thẩm định thủ công chi tiết trên 200 mẫu ngẫu nhiên của HotpotQA để so sánh bản chất thành công và nguyên nhân thất bại giữa ReAct và CoT:
| Chế Độ (Mode) | Mô Tả Lỗi | ReAct | CoT |
|---|---|---|---|
| True Positive | Suy luận và kết quả đều đúng đắn | 94% | 86% |
| False Positive | Đoán đúng đáp án nhưng suy luận bị bịa đặt | 6% | 14% |
| Lỗi suy luận | Logic sai lệch hoặc lặp lại vòng lặp | 47% | 16% |
| Lỗi tìm kiếm | Công cụ search trả về rỗng / sai từ khóa | 23% | — (Không có search) |
| ẢO GIÁC (Hallucination) | Tự bịa đặt dữ kiện không có thật | 0% | 56% |
| Mơ hồ nhãn | Đúng thực tế nhưng khác định dạng nhãn | 29% | 28% |
Vì không có cơ chế đối chiếu thực tế, CoT tự tin bịa ra tên người, ngày tháng và sự kiện lịch sử không có thật để phục vụ cho mạch lý luận. Người dùng rất khó phát hiện vì câu từ cực kỳ trôi chảy.
ReAct chỉ rút ra kết luận dựa trên các đoạn văn bản do API Wikipedia trả về trong quan sát (Observation). Nếu không tìm thấy, mô hình ghi nhận "không tìm thấy" chứ không tự ý sáng chế dữ liệu.
Thực Nghiệm 2: Tác Vụ Ra Quyết Định Tương Tác (ALFWorld & WebShop)
ReAct được đánh giá trên hai môi trường tương tác dài hạn với phần thưởng cực kỳ thưa thớt (sparse rewards):
1. ALFWorld (Text Game Gia Đình)
134 Unseen GamesMô phỏng ngôi nhà thực tế với các nhiệm vụ phức tạp kéo dài hơn 50 bước hành động (ví dụ: "tìm quả táo, rửa sạch tại bồn rửa, làm nóng bằng lò vi sóng rồi đặt lên bàn ăn").
| Phương Pháp | Số Ví Dụ Huấn Luyện | Thành Công Trung Bình |
|---|---|---|
| BUTLER (Học bắt chước) | 105 quỹ đạo/loại | 37% |
| Act-Only Prompting | 2-shot | 45% |
| ReAct (Đề xuất) | Chỉ 2-shot! | 71% (Best of 6) |
2. WebShop (Thương Mại Điện Tử Quy Mô Lớn)
1.18M Sản Phẩm Thực TếWebShop chứa 1.18 triệu sản phẩm cào từ Amazon và 12.000 chỉ dẫn mua sắm đa ràng buộc (ví dụ: "Tìm bàn đầu giường có ngăn kéo, lớp hoàn thiện niken, giá dưới 140$").
| Phương Pháp | Score % | Tỷ Lệ Mua Chuẩn (SR %) |
|---|---|---|
| Imitation Learning (IL) | 59.9 | 29.1% |
| IL + Reinforcement Learning | 62.4 | 28.7% |
| Act-Only (1-shot) | 62.3 | 30.1% |
| ReAct (1-shot Đề xuất) | 66.6 | 40.0% |
Khả Năng Can Thiệp Con Người Trong Vòng Lặp: Kỹ Thuật "Thought Editing"
Một ưu thế độc nhất của ReAct so với các chính sách RL là tính diễn giải bằng lời. Khi tác tử bị bế tắc hoặc lặp lại hành động trong môi trường gia đình ALFWorld, người dùng chỉ cần gõ sửa trực tiếp một dòng suy nghĩ (ví dụ: từ Thought: Không thấy tiêu trong tủ thành Thought: Tiêu có thể ở trên mặt bàn bếp, hãy qua bàn bếp tìm). Tác tử ngay lập tức hấp thụ chỉ dẫn này và hoàn thành nhiệm vụ thành công 100%.
Ánh Xạ Toàn Diện Vào Hệ Thống Trợ Lý AI Nhà Hàng (Aria - SmartRestaurant)
Dự án SmartRestaurant kế thừa trực tiếp phương pháp luận ReAct để xây dựng tác tử tư vấn ẩm thực thông minh Aria, biến từ một chatbot hội thoại thụ động thành một World-Acting System có khả năng nhận thức, truy vấn CSDL, kiểm tra dị ứng và thao tác giỏ hàng bàn ăn theo thời gian thực.
Nếu chỉ dùng Vanilla LLM hoặc CoT
- Ảo giác món ăn: Tự bịa đặt món không có trong bếp, nói sai giá tiền hoặc thành phần gia vị.
- Nguy hiểm dị ứng: Khách báo dị ứng hải sản nhưng mô hình vẫn gợi ý "Canh chua cá bông lau" vì nghĩ cá không phải tôm mực.
- Bất lực thao tác: Khách nói "Thêm cho tôi 2 phần cơm tấm", bot chỉ trả lời "Dạ vâng em đã nhớ" nhưng giỏ hàng vẫn trống rỗng!
Khi Áp Dụng Cơ Chế ReAct Trong Aria
- Tiếp đất CSDL thực đơn: Luôn gọi
search_menuvàfilter_allergenstrước khi trả lời. - Rào chắn an toàn dị ứng: Thought phân tích từng nguyên liệu; nếu nghi ngờ lập tức loại trừ hoặc cảnh báo.
- Thao tác thế giới thực: Kích hoạt
action_mutate_cartcập nhật thẳng vào PostgreSQL/Redis giỏ hàng của bàn.
Ví Dụ Thực Tế: Vết ReAct Của Aria Xử Lý Yêu Cầu Bàn Ăn Phức Tạp
search_menu(category="mon_bo", exclude_allergens=["tom", "dau_phong"], max_price=200000)
search_menu(category="trang_mieng", exclude_allergens=["dau_phong"], max_price=105000)
mutate_cart(table_id="T-05", items=[{"dish_id": "DISH_012", "quantity": 1}, {"dish_id": "DISH_085", "quantity": 2}])
1. Bò Né Hoa Đá Kèm Bánh Mì (1 phần - 145.000đ): Đậm đà, nóng hổi cho 2 người, không chứa tôm/đậu phộng.
2. Panna Cotta Dâu Rừng (2 phần - 90.000đ): Chua ngọt thanh mát tráng miệng, không có thành phần hay rủi ro nhiễm chéo hạt.
• Tổng tiền: 235.000đ (dưới ngân sách 250k). Quý khách có thể xem giỏ hàng trên màn hình và bấm 'Gửi Bếp' khi sẵn sàng ạ!"
action_call_waiter để bàn giao cho nhân viên phục vụ tại bàn xử lý trực tiếp.
Tổng Kết & Tài Liệu Tham Khảo (References)
ReAct đã mở ra kỷ nguyên mới cho Agentic AI: chuyển hóa mô hình ngôn ngữ từ một thực thể tạo sinh chữ viết đơn thuần thành một bộ não ra quyết định tự hành, có khả năng suy nghĩ để lập chiến lược và hành động để tương tác với thế giới thực.
Trích dẫn chuẩn học thuật (BibTeX)
@inproceedings{yao2023react,
title={{ReAct}: Synergizing Reasoning and Acting in Language Models},
author={Shunyu Yao and Jeffrey Zhao and Dian Yu and Nan Du and Izhak Shafran and Karthik Narasimhan and Yuan Cao},
booktitle={International Conference on Learning Representations (ICLR)},
year={2023},
url={https://arxiv.org/abs/2210.03629}
}
Danh mục tài liệu trích dẫn chọn lọc
- Wei et al. (2022b): Chain of thought prompting elicits reasoning in large language models. NeurIPS.
- Wang et al. (2022a): Self-consistency improves chain of thought reasoning in language models. ICLR.
- Yang et al. (2018): HotpotQA: A dataset for diverse, explainable multi-hop question answering. EMNLP.
- Thorne et al. (2018): FEVER: A large-scale dataset for fact extraction and verification. NAACL.
- Shridhar et al. (2020b): ALFWorld: Aligning text and embodied environments for interactive learning. ICLR.
- Yao et al. (2022a): WebShop: Towards scalable real-world web interaction with grounded language agents. NeurIPS.