
Salesforce Koa giảm lỗi CRM, nhưng vẫn thua model frontier mạnh nhất

Trong thông báo ngày 15/9 của Salesforce, Salesforce và NVIDIA công bố Koa tại San Francisco, giới thiệu đây là model suy luận CRM đầu tiên của Salesforce dành cho Agentforce. Hãng nói Koa đạt hiệu năng ngang hoặc cao hơn các model dẫn đầu trong một số hành động CRM với số lỗi ít hơn ba lần, nhưng sản phẩm hiện chỉ dành cho một nhóm khách hàng thí điểm; kế hoạch phát hành rộng rãi mới giới hạn ở các khu vực của Mỹ vào mùa đông năm 2026.
Cùng ngày 15/9, tường thuật của TechCrunch cho biết hai công ty đã hậu huấn luyện Koa từ model Nemotron mở trọng số cho các công việc bán hàng, tiếp thị và hỗ trợ khách hàng, sử dụng dữ liệu tổng hợp thay vì dữ liệu thực của khách hàng Salesforce. Koa vì thế chưa phải một model đã phát hành rộng rãi, mà là lựa chọn chuyên biệt đang được đưa từ sử dụng nội bộ sang các chương trình thí điểm Agentforce.
Koa được xây từ Nemotron cho tác vụ nào
Koa không phải foundation model được huấn luyện từ đầu. Điểm khởi đầu là NVIDIA Nemotron-3-Super-120B; Salesforce chuyên biệt hóa model cho việc gọi công cụ và hoàn thành quy trình tác nhân bằng học tăng cường theo phương pháp Group Relative Policy Optimization.
Quy trình huấn luyện chuyển đặc tả Agent Script thành các phiên mô phỏng nhiều lượt, trong đó mỗi tác nhân có phạm vi công cụ, trạng thái và điều kiện hoàn thành riêng. Phần thưởng phụ thuộc vào việc tác nhân giải quyết yêu cầu dựa trên dữ liệu bằng lời gọi công cụ phù hợp, thay vì chỉ tạo một câu trả lời có vẻ hợp lý.
Những tình huống được nêu công khai gồm tạo khách hàng tiềm năng, đánh giá cơ hội bán hàng và xử lý yêu cầu dịch vụ. Benchmark CRM còn kiểm tra các hành động như cập nhật cơ hội, định tuyến trường hợp hỗ trợ và lên lịch theo dõi. Đây là phạm vi tác vụ cụ thể hơn nhiều so với năng lực tổng quát của một model hội thoại.
“Ít lỗi hơn ba lần” là tuyên bố có phạm vi hẹp
Tuyên bố mạnh nhất của Salesforce là Koa tạo ra số lỗi ít hơn ba lần trong benchmark CRM của hãng. Tuy nhiên, thông cáo không chỉ rõ ngay tại tuyên bố này model đối chứng, mẫu số lỗi hay phép tính dùng để tạo ra tỷ lệ đó. Con số vì thế mô tả kết quả benchmark do nhà cung cấp công bố, không phải bằng chứng rằng mọi doanh nghiệp sẽ giảm lỗi CRM xuống cùng mức khi triển khai thực tế.
Theo paper kỹ thuật về Salesforce Koa, model được hậu huấn luyện từ Nemotron-3-Super-120B bằng GRPO và đạt 0,86 trên CRM Bench, so với 0,84 của model nền, 0,81 của GPT-4.1, 0,87 của Claude Opus 4.8 và 0,90 của GPT-5.5; ở Tau2Bench, điểm trung bình có trọng số tương ứng là 69,41, 68,64, 54,48, 74,00 và 83,99, còn trên BFCL, Koa đạt 66,63%, model nền 64,73%, GPT-4.1 53,96%, Opus 4.8 78,18% và GPT-5.5 67,63%.
Bảng kết quả cho thấy hai điều cùng lúc: Koa cải thiện so với model nền và vượt GPT-4.1 trong ba phép so sánh tổng hợp, nhưng không đứng đầu benchmark nào. Khoảng cách cũng thay đổi đáng kể theo bài kiểm tra, nên không thể lấy một tỷ lệ lỗi duy nhất để đại diện cho mọi loại tác vụ.
Koa vẫn dưới model frontier mạnh nhất
Koa thắng baseline mà Salesforce chọn để nhấn mạnh, nhưng vẫn thua model đạt điểm cao nhất trong từng bảng. Trên CRM Bench và Tau2Bench, GPT-5.5 dẫn đầu; trên BFCL, vị trí cao nhất thuộc về Claude Opus 4.8. Chính nhóm tác giả cũng mô tả Koa là model vượt một baseline sở hữu độc quyền mạnh nhưng còn dưới các model frontier mạnh nhất.
CRM Bench đo các quy trình Salesforce và Agentforce một lượt, với điểm thành phần cho nhận diện chủ đề, gọi hàm và câu trả lời văn bản. Tau2Bench kiểm tra hội thoại dịch vụ khách hàng nhiều lượt trong hàng không, bán lẻ và viễn thông, còn BFCL đánh giá nhiều dạng sử dụng công cụ. Khác biệt về tác vụ và cách chấm giải thích vì sao thứ tự giữa các model không giống nhau ở mọi bảng.
Lợi thế mà Salesforce theo đuổi không chỉ là điểm số cao nhất. Công ty kiểm soát trọng số Koa và vận hành hậu huấn luyện cùng suy luận trong trust boundary của mình, qua đó cung cấp một lựa chọn được lưu trữ bởi Salesforce cho Agentforce. Đây là đặc tính triển khai; nó không làm mất đi khoảng cách hiệu năng còn thấy trong các benchmark công bố.
Benchmark chưa đại diện cho CRM của từng doanh nghiệp
Cả ba bài kiểm tra đều có giới hạn khi áp dụng vào một hệ thống CRM cụ thể. Schema dữ liệu, quyền truy cập, hành động tùy chỉnh, ngôn ngữ, prompt và chính sách phê duyệt của doanh nghiệp có thể khác môi trường benchmark; CRM Bench cũng không cho biết các lỗi còn lại có tập trung vào những hành động nhạy cảm hay không.
Trước khi quyết định mua hoặc chuyển tác vụ Agentforce sang Koa, một phép thử nội bộ cần giữ nguyên cấu hình dự kiến triển khai và so sánh các model trên cùng tập yêu cầu. Phạm vi đánh giá nên gồm:
- độ chính xác đầu cuối và tỷ lệ hoàn thành quy trình;
- lỗi chọn công cụ, sai tham số, câu trả lời sai và hành động vượt quyền;
- số lượt gọi công cụ, lượng token, độ trễ và tỷ lệ cần con người can thiệp;
- hiệu năng tiếng Việt, dữ liệu thiếu, yêu cầu mơ hồ và thay đổi trạng thái qua nhiều lượt.
Đó là cách phân biệt lợi thế chuyên biệt hóa có thể chuyển sang môi trường thật với lợi thế chỉ xuất hiện trên tập thử do nhà cung cấp lựa chọn. Những kết quả hiện có chưa phải đánh giá độc lập trên dữ liệu CRM của khách hàng.
Koa hiện vẫn là sản phẩm thí điểm
Koa đã được Salesforce sử dụng nội bộ và đang chuyển sang thí điểm với một số khách hàng được chọn. Trạng thái này không tương đương phát hành rộng rãi toàn cầu, và lịch công bố hiện chỉ đề cập khả năng phát hành chung tại các khu vực của Mỹ vào mùa đông năm 2026.
Dữ liệu công khai đủ để kết luận Koa vượt Nemotron-3-Super-120B và GPT-4.1 trong các so sánh tổng hợp của paper, nhưng vẫn dưới model frontier dẫn đầu ở cả ba benchmark. Điều còn thiếu là phép thử độc lập trên cấu hình CRM thực tế và phần phân rã chi tiết cho tuyên bố “ít lỗi hơn ba lần”.
Đọc thêm:
Bài viết liên quan


Jalapeño nhanh hơn nhưng chưa bán: giới hạn lớn trong chip AI của OpenAI

Agentforce đạt ARR 1,5 tỷ USD: Salesforce bắt đầu thu tiền từ AI

CrowdStrike lập phòng lab AI phòng thủ, Nvidia cam kết 100 triệu USD

Salesforce rót 166 triệu USD vào HiBob, nhưng IPO vẫn chưa phải ưu tiên

Agentforce làm việc nhiều tuần, nhưng Hunter mới chỉ ở giai đoạn pilot
Đăng ký bản tin
Nhận tin Web3, AI và tiền mã hóa mới nhất ngay trong hộp thư.