Hành trình tiến hóa từ người học thuộc (GPT)

Hành trình tiến hóa từ người học thuộc (GPT) → chuyên gia phân nhiệm (MoE) → nhà lập luận (LRM, HRM) → người đa giác quan (VLM) → người hành động (LAM, ToolFormer). Mục tiêu cuối cùng: AI không chỉ hiểu mà phải suy nghĩ, quyết định và hành động để tạo ra giá trị thực tế.

  1. GPT (General Pretrained Transformer) – Điểm khởi đầu

Huấn luyện trên kho văn bản khổng lồ, biến input thành embedding, qua các lớp transformer để dự đoán từ tiếp theo.

Đây là nền tảng giúp AI hiểu và sinh ngôn ngữ tự nhiên, nhưng vẫn ở mức “dự đoán câu chữ” hơn là giải quyết bài toán phức tạp.

Chưa thực sự suy luận sâu, dễ mắc lỗi logic khi câu trả lời yêu cầu lập luận nhiều bước.

  1. MoE (Mixture of Experts) – Chia nhỏ để tối ưu

Cách tiếp cận: Thay vì để một mô hình làm tất cả, MoE huấn luyện nhiều “chuyên gia” (sub-network) và dùng bộ “gating” chọn nhóm phù hợp cho từng token.

Tác động: Giảm chi phí tính toán mà vẫn tăng hiệu quả ở từng tác vụ chuyên biệt.

Bước tiến: Đây là tư duy “tổ chức bộ phận” thay vì “một người làm hết” giống như đưa bài toán cho đúng chuyên gia để có kết quả nhanh và chính xác hơn.

  1. LRM (Large Reasoning Model) – Suy luận có cấu trúc

Điểm khác biệt: LRM không chỉ tạo ra câu trả lời mà còn tự sinh “chuỗi suy nghĩ” bên trong, đánh giá và chọn đường lập luận hợp lý nhất.

Ứng dụng: Giải các bài toán nhiều bước, đòi hỏi đánh giá và so sánh phương án.

Bước tiến: Từ “trả lời trực tiếp” sang “nghĩ trước – chọn phương án – mới trả lời”, giúp AI bớt kiểu “trả nhanh nhưng sai”.

  1. VLM (Vision Language Model) – Hiểu cả hình lẫn chữ

Chức năng: Kết hợp xử lý hình ảnh và văn bản, tạo embedding chung, suy luận đa phương thức.

Ứng dụng: Phân tích tài liệu chứa cả ảnh và chữ, hỗ trợ nhận diện và mô tả hình ảnh.

Bước tiến: Mở rộng khả năng từ chỉ “nghe – nói” sang “nhìn – hiểu – diễn đạt”, giống như huấn luyện thêm giác quan cho AI.

  1. SLM (Small Language Model) – Gọn nhẹ nhưng nhanh nhạy

Tối ưu: Giảm kích thước mô hình, dùng ít lớp transformer hơn, tập trung vào tốc độ và chi phí thấp.

Ý nghĩa: Phù hợp cho thiết bị giới hạn tài nguyên hoặc ứng dụng yêu cầu phản hồi cực nhanh.

Bước tiến: Đưa AI xuống “tuyến đầu” – chạy ngay trên thiết bị cá nhân thay vì phụ thuộc hoàn toàn vào đám mây.

  1. LAM (Large Action Model) – AI biết hành động

Khả năng: Nhận mô tả nhiệm vụ và trạng thái môi trường, lập kế hoạch hành động (CoT planning), gửi lệnh API hoặc điều khiển hệ thống.

Ứng dụng: Tự động hóa, robot, trợ lý AI ra lệnh và thực thi trong thế giới thật.

Bước tiến: Từ AI “tư vấn” sang AI “ra tay làm” – thu hẹp khoảng cách giữa lời nói và hành động.

  1. HRM (Hierarchical Reasoning Model) – Lập kế hoạch nhiều tầng

Nguyên lý: Chia lập luận thành 2 tầng – tầng cao (H) để lập kế hoạch trừu tượng, tầng thấp (L) để tính toán chi tiết.

Lợi ích: Giải quyết bài toán phức tạp bằng chiến lược “phân rã” đi từ kế hoạch tổng quát xuống hành động cụ thể.

Bước tiến: Giống như quản lý dự án: có “tổng chỉ huy” và “đội thi công” làm việc nhịp nhàng.

  1. ToolFormer – AI biết dùng công cụ

Khả năng: Học cách gọi API, dùng công cụ ngoài để lấy thông tin, tính toán hoặc thao tác dữ liệu.

Ý nghĩa: Giúp AI mở rộng năng lực ngoài phạm vi dữ liệu huấn luyện, truy cập kiến thức và hành động theo thời gian thực.

Bước tiến: Từ AI “tự lực” sang AI “biết tìm trợ giúp” – một kỹ năng sống còn để giải quyết vấn đề thực tế.

 

RELATED POSTS
Share the Post: