Chạy agent code cục bộ với DeepSeek Harness: Laptop cần RAM và VRAM bao nhiêu?

Có một nghịch lý tôi gặp gần như mỗi lần ai đó hỏi về việc dựng trợ lý lập trình chạy tại chỗ: phần mềm điều phối thì nhẹ tới mức chạy được trên laptop văn phòng, còn thứ ngốn…

Chạy agent code cục bộ với DeepSeek Harness: Laptop cần RAM và VRAM bao nhiêu?

Có một nghịch lý tôi gặp gần như mỗi lần ai đó hỏi về việc dựng trợ lý lập trình chạy tại chỗ: phần mềm điều phối thì nhẹ tới mức chạy được trên laptop văn phòng, còn thứ ngốn phần cứng lại nằm phía sau nó. DeepSeek Harness là ví dụ rõ ràng. Kho mã chính chủ chỉ yêu cầu Node.js, không nêu một dòng nào về bộ nhớ. Nhưng khi bạn cắm nó vào một server model chạy cục bộ, ngưỡng RAM và VRAM mới bộc lộ, và nó cao hơn mức nhiều người dự tính. Bài này đo bằng cấu hình máy thực tế, không bằng cảm nhận.

DeepSeek Harness thực chất chỉ là phần vỏ điều phối

DeepSeek Harness, gọi tắt là dsh, là agent harness mã nguồn mở do DeepSeek AI phát hành theo giấy phép MIT. Kiến trúc của nó theo nguyên lý mọi thứ đều là plugin, dựng trên khung Cordis: bộ điều hợp model, danh mục công cụ, sổ ghi phiên và cả vòng lặp agent đều là plugin thay thế được từ cấu hình. Bản mới nhất tôi xác minh trên trang phát hành là v0.1.5-alpha.2 ngày 09/09, vẫn mang nhãn developer preview kèm cảnh báo sẽ có thay đổi phá vỡ tương thích. Chi tiết kiến trúc plugin nằm ở DeepSeek Harness developer preview.

DeepSeek Harness thực chất chỉ là phần vỏ điều phối

Điểm mấu chốt: README của kho mã chỉ ghi một yêu cầu, cài Node.js, rồi mở Web UI ở cổng 3080 bằng lệnh npx. Không có mục cấu hình tối thiểu, không có bảng RAM và VRAM. Trang công bố của DeepSeek cũng vậy. Vậy nên tôi nói thẳng: hãng chưa công bố yêu cầu bộ nhớ cho DeepSeek Harness, và mọi con số gắn cho riêng cái vỏ điều phối này đều là suy diễn. Cái đáng đo là tầng phía dưới, tức server đang nạp trọng số model.

Vì sao tầng đó lại thuộc phạm vi một bài về laptop? Vì tài liệu cấu hình model của DeepSeek Harness cho phép thêm provider tùy chỉnh trỏ vào server tự dựng, khai báo base URL cùng giao thức openai-completions, openai-responses hoặc anthropic-messages. Một server model chạy trên chính laptop của bạn phát ra đúng giao thức openai-completions, nên harness cắm vào được. Lúc đó tiến trình Node vẫn chỉ chiếm vài trăm megabyte, còn bộ nhớ bị model ăn hết. Đây là ranh giới phải nắm trước khi chọn máy.

Dung lượng file model quyết định ngưỡng RAM tối thiểu

Số đầu tiên cần tra là dung lượng file trọng số, vì nó nằm gần như nguyên vẹn trong bộ nhớ khi model hoạt động. Đây cũng là số quyết định phần lớn nhu cầu RAM và VRAM của một cấu hình chạy DeepSeek Harness tại chỗ. Tôi lấy đúng con số ở trang thẻ từng model trên thư viện Ollama, khối Details, gồm lượng tham số, kiểu lượng tử hóa và dung lượng thật của bản tải về. Các họ dưới đây đều đang tồn tại trong thư viện và đều gắn nhãn tools, tức có tool-call, điều kiện bắt buộc để một agent gọi được lệnh và đọc file.

Model và thẻ Tham số Lượng tử hóa Dung lượng Context
qwen3.5:4b 4,66B Q4_K_M 3,4GB 256K
qwen3.5:9b 9,65B Q4_K_M 6,6GB 256K
gemma4:12b 11,9B Q4_K_M 7,6GB 256K
qwen3.5:27b 27,8B Q4_K_M 17GB 256K
qwen3.8:27b 27,3B Q4_K_M 18GB 256K
qwen3-coder:30b 30,5B Q4_K_M 19GB 256K

Dải này trải từ 3,4GB tới 19GB, chênh nhau gần sáu lần. Bản 4b nằm gọn trong máy 16GB RAM. Bản 9b và gemma4:12b, quanh 6,6 – 7,6GB, vẫn ổn trên laptop 32GB. Nhóm 27b tới 30b nhảy lên 17 – 19GB, và đây là chỗ laptop 32GB bắt đầu chật vì hệ điều hành cùng trình biên dịch còn phải chia phần. Ở đầu trên, thư viện Ollama ghi thẳng rằng bản qwen3-coder:480b cần tối thiểu 250GB bộ nhớ khi chạy tại chỗ, con số nằm ngoài mọi laptop.

Nếu bạn muốn bảng đối chiếu theo từng cỡ tham số cho model hội thoại, tôi đã tách riêng ở bài Local LLM: Cấu hình RAM và VRAM cho model 7B đến 70B. Bài đó đo theo cỡ model. Bài này đi theo cách một agent code làm việc thật, và cách làm việc đó mới là thứ đẩy nhu cầu bộ nhớ lên cao.

Context dài khiến KV cache phình nhanh hơn dự tính

Một agent code không hỏi một câu rồi thôi. Nó đọc cây thư mục, mở nhiều file, giữ nguyên nội dung trong lượt hội thoại, gọi công cụ rồi nạp tiếp kết quả trả về. Toàn bộ khối đó nằm trong context, và context chiếm bộ nhớ riêng ngoài trọng số model. Tài liệu Ollama FAQ ghi rõ mặc định cửa sổ context là 4096 token, quá hẹp cho việc đọc một kho mã bằng DeepSeek Harness. Nới lên bằng biến OLLAMA_CONTEXT_LENGTH là việc đầu tiên phải làm, và cũng là việc làm bộ nhớ tăng vọt.

Context dài khiến KV cache phình nhanh hơn dự tính

Cùng tài liệu đó nêu công thức đáng nhớ nhất: RAM cần thiết tỷ lệ theo OLLAMA_NUM_PARALLEL nhân OLLAMA_CONTEXT_LENGTH. Hai biến này đều là thứ một agent kéo lên. Context dài vì phải đọc nhiều file, còn số nhánh song song tăng vì harness cho phép giao việc cho nhiều agent con và chạy nhiều lượt gọi cùng lúc. Nâng context gấp mười lần rồi mở lên hai nhánh song song là nhân phần bộ nhớ đệm lên khoảng hai mươi lần, trong khi trọng số model vẫn y nguyên. Đây là chỗ khác biệt căn bản so với dùng chatbot.

Có hai cách hạ tải mà không phải đổi model. Cách thứ nhất là lượng tử hóa bộ nhớ đệm: tài liệu Ollama xác nhận OLLAMA_KV_CACHE_TYPE đặt q8_0 chiếm khoảng một nửa bộ nhớ so với f16 với sai lệch rất nhỏ, còn q4_0 chỉ chiếm khoảng một phần tư nhưng mất chính xác ở mức nhỏ tới trung bình. Cách thứ hai là giảm số nhánh song song, đánh đổi thời gian chờ. Với DeepSeek Harness, tôi ưu tiên q8_0 rồi mới tính tới việc cắt bớt context.

Ngưỡng cấu hình thực tế cho ba mức RAM phổ biến

Ghép hai phần trên lại thì nhu cầu RAM và VRAM của DeepSeek Harness rơi vào ba ngưỡng khá rạch ròi. Bảng dưới đây tôi dựng từ máy đang còn hàng trong kho Hưng Phát, đời 2025, xếp theo dung lượng bộ nhớ và loại đồ họa để thấy ngưỡng nằm ở đâu. Giá là giá kho ngày 10/09, ghi theo phân khúc chứ không tới từng đồng vì giá thay đổi liên tục.

Laptop Bộ xử lý RAM Đồ họa Giá kho 10/09
DELL Pro 14 Plus PB14250 (2025) Core Ultra 5 236V 16GB Tích hợp tầm 23,5 triệu
DELL Pro 14 Plus PB14255 AMD (2025) Ryzen AI 7 PRO 350 32GB Radeon 860M tầm 24,9 triệu
Lenovo ThinkPad T14s Gen 6 (2025) Core Ultra 7 258V 32GB Arc 140V tầm 44,6 triệu
ThinkPad X1 2-in-1 Gen 10 Aura Edition (2025) Core Ultra 7 265U 64GB Tích hợp tầm 46,9 triệu
Lenovo Legion 5 15IAX10 (2025) Core Ultra 7 255HX 32GB RTX 5060 8GB tầm 50,3 triệu
Lenovo Legion Pro 7 16IAX10H (2025) Core Ultra 9 275HX 32GB RTX 5070 Ti 12GB tầm 70 triệu

Mức 16GB đủ cho model 4b với context vừa phải, hợp với người chỉ muốn thử harness và để nó sửa vài file nhỏ. Mức laptop 32GB là ngưỡng làm việc được: model 9b tới 12b cùng context rộng, hoặc model 27b nếu chấp nhận đóng bớt phần mềm khác. Mức 64GB mới cho phép chạy model 27b tới 30b song song nhiều nhánh mà không phải tính từng gigabyte. Chuẩn cấu hình của LM Studio cũng đặt mốc tương tự, khuyến nghị từ 16GB RAM trở lên trên Windows và ít nhất 4GB VRAM riêng.

Có một chi tiết phần cứng dễ bỏ qua khi cân RAM và VRAM lúc chọn máy: trần bộ nhớ của bộ xử lý. Intel công bố Core Ultra 7 258V trên chiếc T14s Gen 6 chỉ hỗ trợ tối đa 32GB LPDDR5X 8533 MT/s, nghĩa là bản 32GB đã là trần của dòng đó, không có đường nâng thêm. Cùng công bố của Intel, Core Ultra 7 265U trên chiếc X1 2-in-1 Gen 10 hỗ trợ tới 128GB, nên bản 64GB trong kho là cấu hình khả dụng chứ không phải giới hạn kỹ thuật. Với người định chạy agent code lâu dài, trần bộ nhớ quan trọng hơn con số RAM đang cắm sẵn.

Laptop 32GB đồ họa tích hợp và giới hạn khả dụng

Nhóm laptop 32GB đồ họa tích hợp là phương án tôi thấy hợp lý nhất cho phần lớn người chạy DeepSeek Harness, vì model nằm trong RAM hệ thống nên không bị chặn bởi dung lượng VRAM rời. Đại diện gọn gàng là Lenovo ThinkPad T14s Gen 6 (2025) bản Core Ultra 7 258V, 32GB, Arc 140V, giá kho ngày 10/09 tầm 44,6 triệu. Với cấu hình này tôi nạp được model quanh 7GB kèm context rộng mà vẫn còn chỗ cho trình biên dịch và trình duyệt.

Laptop 32GB đồ họa tích hợp và giới hạn khả dụng

Nếu ngân sách hẹp hơn, DELL Pro 14 Plus PB14255 AMD (2025) cho đúng laptop 32GB RAM cùng Radeon 860M ở tầm 24,9 triệu theo giá kho ngày 10/09, chênh gần hai mươi triệu so với chiếc ThinkPad. Bù lại nó chỉ có 512GB SSD, và một thư viện model vài bản 27b là ăn hết phân nửa ổ. Bản DELL Pro 14 Plus PB14250 dừng ở 16GB RAM cùng 256GB SSD, tầm 23,5 triệu, nên tôi xếp nó vào nhóm thử nghiệm chứ không phải nhóm làm việc hằng ngày.

Đầu trên của nhóm tích hợp là ThinkPad X1 2-in-1 Gen 10 Aura Edition (2025) với 64GB RAM cùng 1TB SSD, tầm 46,9 triệu. Chênh lệch giá so với bản T14s 32GB chỉ hơn hai triệu mà dung lượng bộ nhớ gấp đôi, nên xét riêng tiêu chí RAM và VRAM cho agent code thì đây là cấu hình đáng cân nhắc hơn. Nhược điểm chung của cả nhóm vẫn còn đó: đồ họa tích hợp dùng chính RAM hệ thống nên băng thông thấp hơn VRAM rời, tốc độ sinh token chậm hơn rõ khi context dài.

VRAM 8GB và 12GB tạo ra chênh lệch thực tế nào

Khi model nằm trọn trong VRAM, tốc độ sinh token khác hẳn, và câu hỏi thu về còn 8GB hay 12GB. Lenovo Legion 5 15IAX10 (2025) bản Core Ultra 7 255HX, 32GB RAM, RTX 5060 8GB, giá kho ngày 10/09 tầm 50,3 triệu, là mốc dưới cho DeepSeek Harness. Với 8GB VRAM tôi nhét được model 3,4GB hoặc 6,6GB, nhưng phần dư cho bộ nhớ đệm rất mỏng, nên context dài sẽ tràn sang RAM và tốc độ suy giảm ngay tại chỗ tràn.

VRAM 8GB và 12GB tạo ra chênh lệch thực tế nào

Bước lên 12GB thì biên độ dư dả khác hẳn. Bản Lenovo Legion Pro 7 16IAX10H-83F5008VVN (2025) với Core Ultra 9 275HX, 32GB RAM và RTX 5070 Ti 12GB có giá kho ngày 10/09 tầm 70 triệu. Cùng model 6,6GB, phần VRAM còn trống tăng từ khoảng 1,4GB lên khoảng 5,4GB, đủ chứa bộ nhớ đệm của một context rộng ở mức q8_0 mà không phải tràn. Chênh lệch 4GB đổi lấy đúng thứ một agent đọc nhiều file cần nhất.

Ranh giới thật nằm ở nhóm 27b. Model 17 – 19GB không vừa cả 8GB lẫn 12GB VRAM, nên dù mua card 12GB bạn vẫn phải chia tải sang RAM hệ thống. Muốn nhét trọn nhóm đó vào VRAM thì phải nhảy tới bản RTX 5090 24GB của chính chiếc Legion Pro 7, tầm 95 triệu theo giá kho ngày 10/09. Đó là lý do với DeepSeek Harness tôi khuyên chọn laptop 32GB tới 64GB RAM trước, rồi mới tính card rời, thay vì trả tiền cho VRAM mà model vẫn không vừa.

Câu hỏi thường gặp khi chạy agent code cục bộ

DeepSeek Harness có công bố cấu hình tối thiểu không?

Không. README của kho mã chính chủ và trang công bố của DeepSeek chỉ nêu một yêu cầu là cài Node.js, kèm cảnh báo bản hiện tại là developer preview. Hãng chưa đưa ra bảng RAM và VRAM nào cho DeepSeek Harness. Phần cấu hình cần đo là server model bạn dựng phía sau harness, chứ không phải bản thân cái vỏ điều phối.

Laptop 16GB RAM chạy được agent code cục bộ không?

Chạy được ở mức thử nghiệm. Model 4b nặng 3,4GB nằm gọn trong 16GB, đủ để harness đọc và sửa vài file. Điều bạn phải hy sinh là context: với 16GB, nới cửa sổ context lên mức đọc cả kho mã sẽ đẩy bộ nhớ đệm vượt phần RAM còn trống. Nếu công việc chính là refactor nhiều file, tôi khuyên nhắm laptop 32GB trở lên.

Nên ưu tiên thêm RAM hay thêm VRAM trước?

RAM trước. Model dùng cho agent code hiện nay có bản hữu ích nhất nằm ở 17 – 19GB, vượt cả card 12GB, nên VRAM lớn hơn không giúp nhét trọn model mà chỉ giảm phần tràn. Trong khi đó RAM quyết định bạn có nạp nổi model hay không. Khi đã đủ laptop 32GB tới 64GB rồi thì thêm VRAM mới đổi ra tốc độ thấy được, và đó là thứ tự tôi khuyên khi cân RAM và VRAM cho DeepSeek Harness.

Khi nào nên dùng API thay vì chạy model tại chỗ?

Khi bạn cần model lớn hơn mọi laptop. Thư viện Ollama ghi bản qwen3-coder:480b cần tối thiểu 250GB bộ nhớ khi chạy tại chỗ, còn deepseek-v3:671b có file 404GB. Hai mức đó chỉ khả dụng qua API. DeepSeek Harness cho phép khai báo nhiều provider song song, nên cách dùng hợp lý là để model cục bộ lo việc đọc và sửa lặt vặt, còn phần suy luận nặng thì đẩy lên API.

0 phản hồi cho “Chạy agent code cục bộ với DeepSeek Harness: Laptop cần RAM và VRAM bao nhiêu?”

Để lại một bình luận

Email của bạn sẽ không được hiển thị công khai. Các trường bắt buộc được đánh dấu *