Dynamic Model Routing: Cách Snowflake giúp
doanh nghiệp không "đốt tiền" vào AI Agent

Một trong những rào cản lớn nhất khi doanh nghiệp mở rộng quy mô ứng dụng AI agent là chi phí inference/token/credits tăng nhanh hơn dự kiến — đặc biệt khi mọi tác vụ, dù đơn giản hay phức tạp, đều được xử lý bằng cùng một mô hình AI mạnh nhất (và đắt nhất). Snowflake vừa giới thiệu một tính năng mới trong Cortex AI nhằm giải quyết đúng vấn đề này: Dynamic Model Routing.

Dynamic Model Routing là gì?

Dynamic Model Routing là một khả năng mới trong Cortex AI Gateway, tự động chọn mô hình phù hợp và tiết kiệm chi phí nhất cho từng tác vụ trong quá trình agent thực thi — thay vì mặc định dùng các mô hình frontier (mạnh và đắt nhất) cho mọi yêu cầu và không bị lock-in vào bất kỳ vendor AI nào. Thay vì doanh nghiệp dùng rất nhiều loại GPT, Gemini, Claude…trên nhiều nền tảng thì Snowflake có tất cả và hiểu cách tối ưu chi phí.

 

Ý tưởng cốt lõi mà Snowflake gọi là “intelligence efficiency”: không phải tác vụ nào cũng cần mô hình AI mạnh nhất. Việc tạo một bản tóm tắt trạng thái đơn giản và việc tổng hợp phân tích rủi ro danh mục đầu tư phức tạp rõ ràng đòi hỏi mức độ “thông minh” rất khác nhau — nhưng nhiều doanh nghiệp vẫn đang trả cùng một mức chi phí cho cả hai.

 

Cách hoạt động

● Theo mô tả từ Snowflake, hệ thống sẽ:

● Tự động định tuyến các tác vụ đơn giản, lặp lại tới các mô hình hiệu quả về chi phí, trong khi vẫn chuyển các tác vụ đòi hỏi suy luận phức tạp tới mô hình frontier.

● Chỉ hoạt động trong phạm vi các mô hình đã được quản trị viên phê duyệt — đảm bảo tuân thủ chính sách quản trị nội bộ.

● Tôn trọng các ràng buộc về data residency và compliance đã thiết lập.

● Ghi log lại từng quyết định định tuyến, phục vụ minh bạch và audit trail.

  • Tự động cập nhật quyết định định tuyến khi có mô hình mới, mà không cần rebuild lại ứng dụng.

Nói cách khác, đội ngũ kỹ thuật không cần tự tay quyết định “tác vụ này nên dùng model nào” cho từng use case — Cortex AI Gateway sẽ tự tối ưu, trong khi vẫn nằm trong khuôn khổ bảo mật và quản trị dữ liệu đã cấu hình.

Các mô hình mở được hỗ trợ

Tính năng này mở rộng khả năng lựa chọn mô hình cho doanh nghiệp, bao gồm cả các mô hình mã nguồn mở:

●  DeepSeek-V4-Flash 0731 (private preview) — đạt 74,4% trên bộ benchmark ADE-bench, vượt qua một số mô hình độc quyền được thử nghiệm.

●  GLM-5.3 (sắp ra mắt) — kế thừa độ chính xác cao trong tác vụ data engineering của GLM-5.2 (66% trên ADE-bench), với mức tiêu thụ token thấp nhất.

Trên thực tế, danh mục mô hình mà Cortex AI hỗ trợ hiện đã lớn hơn nhiều so với hai cái tên trên — đây cũng là “nguyên liệu” để Dynamic Model Routing có nhiều lựa chọn để định tuyến. Theo tài liệu Snowflake, danh mục này bao gồm cả mô hình đóng (proprietary) lẫn mã nguồn mở, từ nhiều nhà cung cấp:

●  Anthropic — dòng Claude Opus và Claude Sonnet (bao gồm các phiên bản mới nhất), Claude Haiku cho các tác vụ cần tốc độ/chi phí thấp.

●  OpenAI — dòng GPT-5 (gồm cả các bản mini/nano tối ưu chi phí) và GPT-4.1.

●  Google — Gemini 3, được Snowflake tích hợp trực tiếp (native) vào Cortex AI từ đầu năm 2026 trong khuôn khổ mở rộng hợp tác với Google Cloud.

●  Meta — dòng Llama, gồm Llama 4 Maverick và các bản Llama 3.x.

●  Mistral AI — Mistral Large và các phiên bản Mixtral/Mistral nhỏ hơn.

●  DeepSeekGLM (Zhipu AI) — như đã đề cập ở trên.

●  Snowflake Arctic — dòng mô hình embedding và trích xuất dữ liệu (arctic-embed, arctic-extract) do chính Snowflake phát triển, phục vụ các tác vụ tìm kiếm ngữ nghĩa và xử lý văn bản trong nội bộ nền tảng.

Điểm đáng chú ý là danh mục này liên tục được cập nhật — Snowflake bổ sung mô hình mới gần như mỗi quý — nên lợi ích thực sự của Dynamic Model Routing không chỉ nằm ở việc “có nhiều lựa chọn”, mà ở chỗ doanh nghiệp không phải tự theo dõi và cấu hình lại ứng dụng mỗi khi danh mục thay đổi, không bị lock-in vào 1 vendor.

Lợi ích đo lường được

Theo dữ liệu Snowflake công bố:

Hiệu quả sử dụng token tăng tới gấp 3 lần đối với các workload xử lý data pipeline.

Giảm 25% số lượng token cần thiết cho các tác vụ liên quan đến coding.

Chất lượng đầu ra tương đương với cách tiếp cận chỉ dùng mô hình frontier cho mọi tác vụ.

Không cần rebuild ứng dụng khi mô hình nền tảng được cải tiến hoặc thay thế.

Giảm đáng kể chi phí sử dụng AI

Vì sao điều này quan trọng với doanh nghiệp Việt Nam?

Với các doanh nghiệp Việt Nam đang trong giai đoạn thử nghiệm hoặc mở rộng AI agent — từ chatbot nội bộ, trợ lý phân tích dữ liệu, đến tự động hóa quy trình — chi phí inference thường là yếu tố quyết định việc dự án có mở rộng được ra toàn công ty hay mãi dừng ở mức pilot. Việc tối ưu “mô hình nào dùng cho tác vụ nào” theo cách thủ công đòi hỏi năng lực kỹ thuật và thời gian mà không phải đội ngũ nào cũng có sẵn.

 

Dynamic Model Routing đưa phần tối ưu này về phía nền tảng, giúp doanh nghiệp:

 

●  Kiểm soát chi phí AI tốt hơn khi mở rộng quy mô sử dụng, thay vì chi phí tăng tuyến tính theo số lượng yêu cầu.

●  Vẫn giữ được quyền kiểm soát: chỉ những mô hình được phê duyệt mới được sử dụng, phù hợp với các ngành có yêu cầu tuân thủ chặt như y tế, ngân hàng, tài chính, bảo hiểm tại Việt Nam.

Có thêm lựa chọn giữa mô hình đóng và mô hình mở, tránh phụ thuộc hoàn toàn vào một nhà cung cấp AI duy nhất.

Kết luận

Dynamic Model Routing cho thấy hướng đi rõ ràng của Snowflake: AI agent trong doanh nghiệp không chỉ cần “thông minh”, mà còn cần “thông minh đúng chỗ, đúng chi phí”. Đây là yếu tố các doanh nghiệp Việt Nam nên đưa vào tiêu chí đánh giá khi lựa chọn nền tảng AI/dữ liệu, đặc biệt khi bài toán không chỉ dừng ở việc chạy thử một use case, mà là mở rộng AI ra toàn tổ chức mà vẫn kiểm soát được ngân sách.

Nếu doanh nghiệp của bạn đang cân nhắc ứng dụng Snowflake, SIFT cung cấp:

●   Tư vấn đánh giá mức độ sẵn sàng dữ liệu (miễn phí)

●   Thiết kế kiến trúc Snowflake phù hợp với hạ tầng hiện tại

●   Triển khai pilot trong 4 – 6 tuần và tài trợ tài khoản sử dụng miễn phí

 

Liên hệ đội ngũ SIFT:

 

ThS. Phan Thị Thu Thùy
Country Manager – SIFT Analytics Group Vietnam
Zalo: https://zalo.me/0931045700
Email: sift-vn@sift-ag.com
Website: https://sift-ag.com/ibm-spss-vn/


Nguồn tham khảo: Snowflake.com/blog (Dynamic Model Routing with Open Models in Cortex AI); Snowflake Documentation — Models and regional availability for Cortex AI Functions; TechTarget — Snowflake boosts Google partnership, integrates Gemini 3.