MLOps
Triển khai mô hình inference với Docker & GPU
0lượt xem0bình luận
Đóng gói model serving thành container, quản lý tài nguyên GPU cho nhiều replica.
Tổng quan
Bài viết hướng dẫn đóng gói một model open-weight (Llama 3, Mistral) thành container phục vụ inference.
Đóng gói container
Base image có sẵn CUDA runtime, cấu hình biến môi trường chọn model và tham số suy luận.
Quản lý GPU
Chia sẻ GPU giữa nhiều replica cần cấu hình memory limit cẩn thận để tránh out-of-memory.
Tags
mlopsgpu
Danh mục
MLOps · AI