Suy luận kết hợp

Google cung cấp nhiều mô hình và API AI hàng đầu trong ngành cho cả suy luận dựa trên đám mây và trên thiết bị. Suy luận kết hợp cho phép bạn cân bằng liền mạch các tải công việc AI giữa thiết bị cục bộ và đám mây, tối ưu hoá hiệu suất, chi phí và khả năng cung cấp.

Suy luận kết hợp mang lại 2 lợi ích chính cho ứng dụng Android của bạn:

  • Tối đa hoá phạm vi tiếp cận: Các mô hình đám mây đóng vai trò là phương án dự phòng quan trọng khi các mô hình trên thiết bị (chẳng hạn như Gemini Nano) không dùng được do các hạn chế về phần cứng thiết bị hoặc hệ điều hành. Điều này giúp đảm bảo các tính năng AI của bạn vẫn hoạt động trên nhiều thiết bị người dùng nhất có thể.
  • Chi phí và khả năng hoạt động khi không có mạng: Các mô hình trên thiết bị giúp đảm bảo các tính năng AI của bạn hoạt động liền mạch khi người dùng không có mạng. Ngoài ra, việc chuyển các tác vụ thường xuyên sang thiết bị cục bộ giúp giảm chi phí suy luận trên đám mây.

Sau đây là những lợi ích của tính năng suy luận trên thiết bị và suy luận trên đám mây:

Suy luận trên thiết bị Suy luận trên đám mây
Có thể sử dụng khi không có mạng Tương thích với mọi thiết bị
Không mất chi phí suy luận Các tính năng nâng cao của mô hình

Các lựa chọn triển khai

Bạn có thể triển khai suy luận kết hợp bằng các phương pháp sau:

Firebase AI Logic Hybrid API

Firebase AI Logic Hybrid API cung cấp một giao diện hợp nhất, duy nhất để định tuyến suy luận giữa các mô hình trên đám mây và trên thiết bị.

  • Tự động chuyển đổi: Bạn có thể định cấu hình ứng dụng để chạy các tác vụ AI trên thiết bị bất cứ khi nào có thể. Điều này có nghĩa là tính năng của ứng dụng sẽ hoạt động khi không có mạng, có quyền riêng tư nâng cao và không phát sinh chi phí suy luận trên đám mây. Nếu không có mô hình trên thiết bị, SDK có thể tự động định tuyến yêu cầu đến mô hình Gemini được lưu trữ trên đám mây.
  • Bảo vệ chống hành vi sai trái: Việc gọi trực tiếp Cloud APIs từ một ứng dụng di động có thể gây rủi ro làm lộ thông tin đăng nhập và dẫn đến các khoản phí không mong muốn. Tuy nhiên, khi sử dụng Firebase AI Logic, bạn cũng sẽ thực thi Firebase App Check. Tính năng này có thể giúp ngăn chặn hành vi sai trái bằng cách xác minh rằng chỉ ứng dụng chính hãng, chưa bị giả mạo của bạn mới có thể truy cập vào Gemini API trên đám mây.
  • Hạn mức chi tiêu: Khi định tuyến các yêu cầu đến các mô hình được lưu trữ trên đám mây, bạn có thể định cấu hình hạn mức chi tiêu để giúp bảo vệ ngân sách trên đám mây và tránh các khoản phí ngoài dự kiến.

Trong ứng dụng, bạn xác định tham số onDeviceConfig để kiểm soát chế độ suy luận và quản lý việc định tuyến:

  • PREFER_ON_DEVICE: Cố gắng sử dụng mô hình trên thiết bị; tự động chuyển về mô hình được lưu trữ trên đám mây nếu mô hình trên thiết bị không có sẵn hoặc không được hỗ trợ cho yêu cầu.

  • PREFER_IN_CLOUD: Cố gắng sử dụng mô hình được lưu trữ trên đám mây khi thiết bị đang trực tuyến và mô hình này có sẵn; chỉ chuyển về mô hình trên thiết bị nếu thiết bị đang ngoại tuyến.

  • ONLY_ON_DEVICE: Cố gắng sử dụng mô hình trên thiết bị; ném một trường hợp ngoại lệ nếu mô hình trên thiết bị không dùng được hoặc không được hỗ trợ cho yêu cầu.

  • ONLY_IN_CLOUD: Cố gắng sử dụng mô hình được lưu trữ trên đám mây khi thiết bị đang trực tuyến và mô hình có sẵn; đưa ra một ngoại lệ trong tất cả các trường hợp khác.

val model = Firebase.ai(backend = GenerativeBackend.Companion.googleAI())
    .generativeModel(
        modelName = "gemini-3.5-flash",
        onDeviceConfig = OnDeviceConfig(mode = InferenceMode.Companion.PREFER_ON_DEVICE)
    )

val response = model.generateContent("Write a story about a green robot.")
print(response.text)

Để biết thông tin chi tiết về cách triển khai, hãy xem tài liệu về Firebase và khám phá mẫu AI kết hợp trong danh mục AI.

Việc chuyển đổi khối lượng công việc sang đám mây có thể làm lộ các điểm cuối API đám mây. Khi sử dụng Firebase AI Logic, bạn có thể truy cập an toàn vào các mô hình Gemini dựa trên đám mây ngay từ các ứng dụng phía máy khách bằng cách thực thi tính năng Kiểm tra ứng dụng Firebase. Tính năng này giúp bảo vệ suy luận dựa trên đám mây khỏi hành vi truy cập trái phép và lạm dụng tính phí. Điều này giúp cơ chế dự phòng kết hợp của bạn luôn hoạt động và an toàn.

Định tuyến tuỳ chỉnh

Nếu ứng dụng của bạn có các yêu cầu cụ thể về nghiệp vụ hoặc trải nghiệm người dùng, thì bạn cũng có thể triển khai logic định tuyến tuỳ chỉnh. Điều này cho phép bạn xác định một cách linh hoạt đường dẫn suy luận dựa trên các yếu tố theo thời gian thực, chẳng hạn như:

  • Độ trễ mạng
  • Tình trạng hệ thống của thiết bị (ví dụ: mức pin và mức tải của bộ xử lý)
  • Độ phức tạp của truy vấn người dùng

Phương pháp suy luận kết hợp tuỳ chỉnh này được dùng bởi các ứng dụng hàng đầu đã triển khai quy trình định tuyến tuỳ chỉnh của riêng mình để mang lại trải nghiệm AI đáng tin cậy, bao gồm:

  • Gboard: Gboard sử dụng suy luận kết hợp tuỳ chỉnh để hỗ trợ các công cụ viết như hiệu đính và viết lại.

  • Kakao Mobility: Kakao Mobility đã xây dựng một công cụ Trích xuất thực thể bằng cách sử dụng suy luận kết hợp tuỳ chỉnh cho dịch vụ giao hàng bưu kiện của họ. Công cụ này tự động trích xuất tên, địa chỉ và số điện thoại của người nhận từ các tin nhắn bằng ngôn ngữ tự nhiên để đơn giản hoá mẫu đơn đặt hàng.