Có một nghịch lý khiến nhiều người mới chạy AI cục bộ trên laptop bối rối: đổi từ Ollama sang LM Studio hoặc ngược lại, tốc độ sinh token gần như không đổi, nhưng đổi laptop thì con số có thể chênh lệch năm đến bảy lần. Nguyên nhân nằm ở chỗ cả hai ứng dụng đều dựng trên cùng một engine suy luận llama.cpp.
Tôi chọn bốn model AI cục bộ open-weight cỡ 8B đến 14B phát hành từ cuối 2025 đến 08/2026, đối chiếu dung lượng file GGUF với VRAM và RAM của ba mẫu laptop đời 2025 đang bán, rồi tổng hợp các số đo tokens/s đã công bố từ nguồn kiểm chứng được. Phần phương pháp đo được ghi rõ để bạn tự lặp lại trên chính laptop của bạn.
Vì sao LM Studio và Ollama cho tốc độ gần như tương đồng
LM Studio là ứng dụng giao diện đồ họa, đóng gói sẵn hai engine: llama.cpp cho định dạng GGUF trên Windows, Linux, Mac và MLX dành riêng cho chip Apple. Ollama là dịch vụ chạy nền, điều khiển bằng dòng lệnh hoặc API, cũng dựng trên llama.cpp và các bản gần đây có thêm MLX cho máy Mac. Bản v0.33.3 phát hành ngày 02/09/2026 ghi rõ trong nhật ký cập nhật: MLX, MLX-C, llama.cpp update.
Khi cùng model, cùng mức lượng tử hóa Q4_K_M, cùng số lớp nạp lên GPU, hai ứng dụng thực chất gọi cùng một đoạn mã tính toán. Chênh lệch tốc độ sinh token thường dưới 10%, nằm trong biên độ sai số giữa hai lần chạy. Vì vậy tôi không coi so sánh tokens/s giữa hai app là câu hỏi mấu chốt.
Điểm khác biệt có ý nghĩa nằm ở bốn yếu tố khác. Thứ nhất là cách mỗi app nhận diện GPU: Ollama trên Windows từng không nhận iGPU Radeon 860M qua Vulkan (issue #14562 mở ngày 02/03/2026, bản 0.17.x), trong khi LM Studio cho phép chọn thủ công backend Vulkan hoặc CUDA. Thứ hai là mức chiếm dụng RAM của giao diện. Thứ ba là cách xử lý khi model tràn VRAM. Thứ tư là quy trình cập nhật engine, LM Studio 0.3.32 bật Flash Attention mặc định cho Vulkan và Metal sớm hơn.
Nói cách khác, khi bạn thấy hai laptop chạy AI cục bộ cho kết quả khác nhau, hãy tìm nguyên nhân ở băng thông bộ nhớ, dung lượng VRAM và giới hạn nhiệt trước khi đổ lỗi cho phần mềm.
Bốn model 7B đến 14B mới nhất được đưa vào đối chiếu
Tôi lọc theo ba tiêu chí: trọng số mở với giấy phép Apache 2.0, kích thước 8B đến 14B tham số, và có sẵn tag chính thức trên thư viện Ollama lẫn LM Studio để bạn tải bằng một lệnh. Dung lượng ghi trong bảng là file GGUF mặc định của Ollama, tương ứng mức lượng tử hóa Q4_K_M.
Qwen3.5-9B của Alibaba phát hành đầu tháng 03/2026, hỗ trợ ảnh và ngữ cảnh 262K token, đạt hơn 11 triệu lượt tải trong 30 ngày gần nhất theo thống kê Hugging Face. Bạn có thể xem thẻ model chính chủ tại Qwen/Qwen3.5-9B.
| Model | Hãng, thời điểm | GGUF Q4_K_M | Ngữ cảnh | Tag Ollama |
|---|---|---|---|---|
| Granite 4.2 8B | IBM, 08/2026 | 5,3 GB | 128K | granite4.2:8b |
| Qwen3.5-9B | Alibaba, 03/2026 | 6,6 GB | 256K | qwen3.5:9b |
| Gemma 4 12B | Google DeepMind, 06/2026 | 7,6 GB | 256K | gemma4:12b |
| Ministral 3 14B | Mistral AI, 12/2025 | 9,1 GB | 256K | ministral-3:14b |
Gemma 4 12B là bản bổ sung muộn của Google, ra ngày 03/06/2026 sau các cỡ E2B, E4B, 26B và 31B hồi đầu tháng 4. Bản 12B nạp được ảnh, âm thanh, video và có phiên bản QAT dành riêng cho lượng tử hóa 4 bit. Thư viện chính chủ nằm tại gemma4, còn LM Studio liệt kê file 7,4 GB dưới tên google/gemma-4-12b.
Granite 4.2 8B của IBM là model mới nhất trong nhóm, xuất hiện trên thư viện Ollama cuối tháng 08/2026 với chế độ suy luận tích hợp. Ministral 3 14B tuy ra từ 12/2025 nhưng vẫn là model dense 14B mới nhất có tag chính thức, và cũng là trường hợp duy nhất vượt 8 GB ở mức Q4_K_M.
Phương pháp đo tốc độ token để bạn tự lặp lại
Tôi không sở hữu đủ ba mẫu laptop dưới đây để đo cùng lúc, nên số liệu trong bảng là các số đo công bố trên nguồn kiểm chứng được, ghi rõ cấu hình và ngày đo. Chúng dùng model cùng cỡ và cùng mức lượng tử hóa, không phải bốn model mới ở trên. Vì tốc độ sinh token phụ thuộc chủ yếu vào dung lượng file và băng thông bộ nhớ, model mới cùng cỡ GGUF sẽ cho kết quả xấp xỉ.
Cách đo AI cục bộ tin cậy nhất là chạy đúng lệnh trên laptop của bạn. Với Ollama, gõ ollama run gemma4:12b –verbose rồi đặt một câu hỏi dài khoảng 200 từ, dòng eval rate ở cuối chính là tokens/s sinh ra. Với LM Studio, con số hiển thị ngay dưới mỗi câu trả lời. Muốn số chuẩn hơn, tải llama.cpp và chạy llama-bench -m file.gguf -p 512 -n 128, công cụ này lặp năm lần và báo cả độ lệch chuẩn.
| Cấu hình đo | Model, Q4_K_M | Backend | Sinh token | Nguồn, ngày |
|---|---|---|---|---|
| RTX 5060 8GB (bản để bàn) | Mistral 7B | Ollama 0.9.5, CUDA | 72,9 tok/s | Database Mart, 25/08/2026 |
| RTX 5060 8GB (bản để bàn) | DeepSeek-R1 7B | Ollama 0.9.5, CUDA | 58,5 tok/s | Database Mart, 25/08/2026 |
| Core Ultra 7 258V, Arc 140V | Qwen3 8B | Ollama 0.9.3, IPEX-LLM | 17 đến 18 tok/s | GitHub Gist, 06/2026 |
| Core Ultra 7 258V, chỉ CPU | Qwen3 8B | Ollama 0.9.3, CPU | 9,2 tok/s | GitHub Gist, 06/2026 |
| Ryzen AI 7 PRO 350, Radeon 860M | Qwen3 4B | llama.cpp, Vulkan | 18,5 tok/s | Zenn, 17/05/2026 |
| Ryzen AI 7 PRO 350, Radeon 860M | Qwen3 14B | llama.cpp, Vulkan | 5,6 tok/s | Zenn, 17/05/2026 |
Bạn đọc bảng theo hai nguyên tắc. Một, model dưới 10B trên GPU rời 8 GB chạy được ở ngưỡng 30 đến 70 tok/s tùy nguồn và mức tiêu thụ điện; bản laptop của RTX 5060 giữ nguyên băng thông 448 GB/s nhưng TGP thấp hơn nên tôi kỳ vọng số thấp hơn bản để bàn. Hai, iGPU chỉ tăng gấp đôi so với CPU khi backend nhận đúng thiết bị; tốc độ 15 đến 20 tok/s vẫn đủ đọc theo thời gian thực vì tốc độ đọc thông thường chỉ quanh 3 đến 5 từ mỗi giây.
Kết quả 14B trên iGPU chỉ 5,6 tok/s là cảnh báo cho cả LM Studio lẫn Ollama: khi model lớn gấp đôi mà băng thông LPDDR5X không đổi, tốc độ giảm hơn ba lần. Đây là giới hạn phần cứng của AI cục bộ, không app nào bù đắp được.
Laptop iGPU 32GB và 16GB xử lý AI cục bộ ra sao
Laptop văn phòng dùng chip Lunar Lake hoặc Ryzen AI 300 là trường hợp thú vị nhất, vì RAM hợp nhất cho phép nạp model 12B, thậm chí 14B, thứ mà GPU rời 8 GB phải từ chối. Cái giá phải trả là băng thông: LPDDR5X-8533 của Core Ultra 7 258V đạt khoảng 136 GB/s, bằng một phần ba RTX 5060.
ThinkPad T14s Gen 6 (2025) bản Core Ultra 7 258V có 32 GB RAM hàn onboard, giá tại Hưng Phát tầm 44,6 đến 49,4 triệu. Với 32 GB, bạn nạp Gemma 4 12B hoặc Ministral 3 14B mà vẫn dư chỗ cho trình duyệt và IDE. Theo số đo trên cùng chip, Qwen3 8B đạt 17 đến 18 tok/s qua IPEX-LLM; ước lượng theo tỷ lệ dung lượng file, Gemma 4 12B với 7,6 GB sẽ nằm quanh ngưỡng 10 tok/s, còn 14B rơi về 6 đến 8 tok/s; bạn nên tự đo lại để có số chính xác.
Điểm cần lưu ý với Lunar Lake là backend. Ollama bản chuẩn trên Windows chưa khai thác tốt Arc 140V, còn bản IPEX-LLM của Intel cho số tốt hơn nhưng phải cài thủ công. LM Studio cho phép chuyển giữa Vulkan và CPU ngay trong mục Runtime, tiện hơn khi bạn cần đối chiếu nhanh.
Ở phân khúc 16 GB, DELL 14 Plus DB14250 (2025) bản Ryzen AI 7 PRO 350, Radeon 860M, giá tầm 23 triệu, là ví dụ điển hình. RAM 16 GB chỉ nên dành cho model đến 9B: Windows và ứng dụng nền đã chiếm 4 đến 5 GB, Qwen3.5-9B chiếm thêm 6,6 GB cộng bộ nhớ ngữ cảnh. Nạp Gemma 4 12B vẫn khả thi nhưng máy sẽ dùng file hoán đổi, tốc độ suy giảm rõ rệt. Bạn tham khảo thêm cách tính dung lượng trong bài Local LLM: Cấu hình RAM và VRAM cho model 7B đến 70B.
Riêng với Radeon 860M, trước khi mua bạn nên xác minh phiên bản Ollama đã nhận iGPU này trên Windows hay chưa, vì đầu 2026 nhiều người phải chạy bằng CPU. Số đo Zenn cho thấy Qwen3 4B trên CPU Ryzen AI 7 PRO 350 đạt 20,9 tok/s, thậm chí nhỉnh hơn iGPU qua Vulkan ở ngữ cảnh ngắn, nên đây không phải thảm họa, chỉ là điện năng và nhiệt cao hơn.
Laptop RTX 5060 8GB chạy LM Studio với model 12B và 14B
GPU rời 8 GB là cấu hình phổ biến nhất ở laptop gaming 2025 chạy AI cục bộ, và cũng là nơi bốn model trên phân hóa rõ nhất. Granite 4.2 8B (5,3 GB) và Qwen3.5-9B (6,6 GB) nạp trọn vào VRAM, dư chỗ cho ngữ cảnh 8K đến 16K token. Gemma 4 12B với 7,6 GB nằm sát trần: bạn phải giảm ngữ cảnh xuống 4K hoặc chấp nhận đẩy vài lớp sang RAM.
Lenovo Legion 5 15IAX10 (2025) là mẫu tôi lấy làm tham chiếu cho nhóm này: Core Ultra 7 255HX 20 nhân, RTX 5060 8 GB GDDR7 băng thông 448 GB/s, RAM 32 GB DDR5-5600 và màn WQXGA OLED 165 Hz, giá tại Hưng Phát tầm 50,3 triệu. RAM 32 GB là điểm cộng cho trường hợp tràn VRAM, còn 20 nhân CPU giữ tốc độ đọc prompt dài không bị nghẽn. Bạn xem cấu hình chi tiết tại trang Lenovo Legion 5 15IAX10 (2025).
Ministral 3 14B với 9,1 GB chắc chắn tràn VRAM. Khi đó llama.cpp chia lớp giữa GPU và CPU, và tốc độ tụt từ vài chục tok/s xuống dưới 10 tok/s vì băng thông PCIe và RAM DDR5 thấp hơn GDDR7 gấp nhiều lần. LM Studio hiển thị thanh ước lượng bộ nhớ trước khi nạp và cho kéo số lớp GPU bằng tay; Ollama tự phân bổ, muốn can thiệp bạn phải đặt biến num_gpu. Đây là khác biệt tiện dụng rõ nhất của LM Studio với người mới.
Điều tôi muốn bạn kiểm tra khi chạy AI cục bộ trên laptop gaming là nhiệt và xung nhịp sau 10 phút sinh token liên tục. Mức tiêu thụ điện của RTX 5060 Laptop dao động theo TGP từng hãng, và khi GPU chạm ngưỡng nhiệt, tốc độ có thể suy giảm 15 đến 20% so với phút đầu. Chạy llama-bench hai lần cách nhau 10 phút, nếu số lần hai thấp hơn rõ rệt thì bạn cần chế độ quạt Performance hoặc đế tản nhiệt.
Một chi tiết nhỏ nhưng có ích: Ollama giữ model trong VRAM 5 phút sau lần gọi cuối rồi giải phóng, còn LM Studio giữ đến khi bạn eject. Với laptop 8 GB VRAM vừa chạy AI vừa chơi game, hành vi của Ollama tránh được tình trạng game giật vì thiếu bộ nhớ.
Chọn LM Studio hay Ollama theo thói quen làm việc của bạn
Sau khi loại bỏ yếu tố tốc độ, lựa chọn giữa hai app AI cục bộ quy về cách bạn dùng model hằng ngày. Tôi tóm tắt các khác biệt thực chất trong bảng dưới, dựa trên phiên bản LM Studio 0.3.x và Ollama 0.33.x hiện hành.
Nếu bạn tóm tắt PDF, đối chiếu hợp đồng hoặc thử nhiều model trong ngày, giao diện của LM Studio tiết kiệm thời gian đáng kể nhờ tính năng chat với tài liệu và bộ lọc model theo dung lượng RAM khả dụng. Nếu bạn viết mã, cần trợ lý AI trong IDE hoặc chạy nhiều ứng dụng gọi chung một backend, Ollama gọn hơn, khởi động cùng hệ điều hành và không chiếm cửa sổ.
| Tiêu chí | LM Studio 0.3.x | Ollama 0.33.x |
|---|---|---|
| Engine suy luận | llama.cpp, MLX | llama.cpp, MLX |
| Chọn backend GPU | Thủ công: CUDA, Vulkan, CPU | Tự động, sửa bằng biến môi trường |
| Ước lượng bộ nhớ trước khi nạp | Có, hiển thị ngay khi chọn model | Không, xem sau bằng ollama ps |
| Giữ model trong bộ nhớ | Đến khi eject | Mặc định 5 phút sau lần gọi cuối |
| API tương thích OpenAI | Cổng 1234, bật thủ công | Cổng 11434, luôn sẵn sàng |
| Phù hợp nhất | Thử model, làm việc với tài liệu | Lập trình, tự động hóa, nhiều ứng dụng |
Không có gì ngăn bạn cài cả app này lẫn Ollama. Model GGUF tải bằng LM Studio có thể đăng ký vào Ollama qua Modelfile, nên bạn không phải tải hai lần cùng một file 7,6 GB. Tôi dùng LM Studio để thử model mới trong tuần đầu, rồi chuyển model phù hợp sang Ollama làm backend cho công cụ viết mã.
Điều duy nhất tôi khuyên bạn không làm là mua laptop AI cục bộ dựa trên app. Hãy chọn theo dung lượng bộ nhớ và băng thông phù hợp với model bạn định chạy: 16 GB RAM cho model đến 9B, 8 GB VRAM cho tốc độ cao ở model dưới 10B, và 32 GB RAM hợp nhất khi bạn cần nạp 12B đến 14B mà chấp nhận tốc độ đọc chậm.
Câu hỏi thường gặp về LM Studio và Ollama trên laptop
LM Studio có nhanh hơn Ollama trên cùng laptop không?
Không đáng kể. Cả hai dùng llama.cpp, chênh lệch thường dưới 10% và đổi chiều tùy phiên bản engine mỗi bên cập nhật. Muốn tăng tốc, hãy giảm mức lượng tử hóa, rút ngắn ngữ cảnh hoặc đảm bảo model nạp trọn vào VRAM.
Laptop 16GB RAM không có GPU rời chạy được model nào?
Với AI cục bộ, model đến 9B ở mức Q4_K_M, tương ứng file 5 đến 7 GB. Granite 4.2 8B và Qwen3.5-9B là hai lựa chọn hợp lý; tốc độ trên CPU hoặc iGPU nằm quanh 8 đến 20 tok/s tùy chip.
Gemma 4 12B có chạy được trên RTX 5060 8GB không?
Được, nhưng file 7,6 GB gần chạm trần 8 GB, phần còn lại không đủ cho ngữ cảnh dài. Bạn nên đặt ngữ cảnh 4K, hoặc dùng bản QAT và chấp nhận đẩy vài lớp sang RAM, chậm hơn nhưng ổn định.
Làm sao biết model đang chạy trên GPU hay CPU?
Với Ollama, gõ ollama ps, cột PROCESSOR ghi tỷ lệ GPU/CPU. Với LM Studio, mục Runtime hiển thị backend đang dùng và số lớp đã nạp lên GPU. Kết hợp Task Manager để xem VRAM đã dùng là đủ kết luận model AI cục bộ đang chạy ở đâu.







Để lại một bình luận