← Tất cả công cụ

CÔNG CỤ · AI & LLM

LLM VRAM Calculator

Miễn phíƯớc tính nhanh

Xem video giới thiệu model AI chạy local rồi mà không biết máy mình có kham nổi? Chọn model, mức lượng tử và ngữ cảnh để biết cần bao nhiêu bộ nhớ.

01 · Model
02 · Lượng tử hoá

Số bit cho mỗi trọng số. Q4_K_M là lựa chọn phổ biến: nhẹ mà chất lượng gần bản gốc.

03 · Ngữ cảnh

Ngữ cảnh càng dài, KV cache càng tốn bộ nhớ. Model này hỗ trợ tối đa 131.072 token.

Kiểu KV cache

Q8_0 hoặc Q4_0 giảm bộ nhớ cho ngữ cảnh (llama.cpp: --cache-type-k/v; Ollama: OLLAMA_KV_CACHE_TYPE). Mỗi yêu cầu chạy cùng lúc cần KV cache riêng.

Bộ nhớ cần

Tổng cộng khoảng 6,2 GB

Trọng số model
4,5 GB
KV cache
1,0 GB
Bộ đệm & runtime
0,7 GB

File model tải về khoảng 4,5 GB.

Máy nào chạy được?

  • RTX 3050 / 4060dùng được ~7,5 GBChạy tốt
  • RTX 3060 12 GBdùng được ~11,3 GBChạy tốt
  • RTX 4060 Ti 16 GB / 4080dùng được ~15,0 GBChạy tốt
  • RTX 3090 / 4090dùng được ~23 GBChạy tốt
  • RTX 5090dùng được ~30 GBChạy tốt
  • Mac 16 GBdùng được ~10,7 GBChạy tốt
  • Mac 24 GBdùng được ~16,1 GBChạy tốt
  • Mac 36 GBdùng được ~24 GBChạy tốt
  • Mac 64 GBdùng được ~48 GBChạy tốt
  • Mac 128 GBdùng được ~96 GBChạy tốt
  • H100 80 GBdùng được ~75 GBChạy tốt

Ước tính theo công thức trọng số + KV cache + bộ đệm; thực tế lệch khoảng 10–20% tuỳ phần mềm (llama.cpp, Ollama, LM Studio, vLLM). Mac dùng bộ nhớ chung với hệ điều hành.

Tool này đang miễn phí. Thấy hữu ích thì mời tui 1 ly cà phê ☕