Có hai câu trả lời rất tự tin cho câu hỏi “tôi có nên chạy model ở local không”, và cả hai đều sai. Một phe bảo model local giờ đủ tốt rồi, trả tiền cho API là phí. Phe kia bảo thứ gì nhét vừa cái laptop thì cũng chỉ là đồ chơi, đừng phí buổi tối. Câu trả lời có ích là: “local hay API” vốn không phải câu hỏi về model. Nó là câu hỏi về một workload cụ thể, và xoay quanh bốn thuộc tính của workload đó — dữ liệu có được phép rời khỏi máy không, mỗi tháng bạn đẩy qua bao nhiêu token, có mạng hay không, và một vòng round trip ăn mất bao nhiêu phần trong ngân sách độ trễ. Nếu không thuộc tính nào trong bốn cái đó ràng buộc bạn, gần như chắc chắn API là lựa chọn đúng, và lý do trung thực là năng lực: với reasoning thật sự khó, model frontier bạn đi thuê vẫn thắng model đã quantise bạn sở hữu. Bài này nói phần nhượng bộ trước, rồi tới bốn trường hợp mà local không phải là sự thỏa hiệp mà là đáp án đúng, rồi tới phần cơ chế: làm sao biết model có vừa bộ nhớ không trước khi tải 40 GB, quantisa...