Tổng hợp các mô hình Ollama mới nhất – Phân loại theo mục đích sử dụng + RAM/VRAM + SWE-bench
Ollama hiện là một trong những nền tảng mạnh nhất để chạy mô hình ngôn ngữ lớn (LLM) tại chỗ (local), không phụ thuộc API bên ngoài và giữ toàn quyền dữ liệu.
Tuy nhiên, việc chọn mô hình đúng nhu cầu vẫn còn khó khăn nếu không có bảng so sánh rõ ràng.
Trong bài này, chúng ta sẽ:
✅ Phân loại mô hình theo mục đích sử dụng
✅ Cho biết RAM và VRAM cần thiết
✅ Kèm lệnh ollama pull cho từng mô hình
✅ Chỉ đi kèm SWE-bench Verified với model thật sự phù hợp
🚀 1. Nhóm Chat tổng quát (General Chat / QA / reasoning)
Nhóm này phù hợp cho các tác vụ như:
• Trò chuyện tự nhiên
• Hỏi đáp đơn giản
• Tổng hợp ý tưởng
• Phân tích kiến thức chung
Mục tiêu là phản hồi mạch lạc, ổn định, không quá nặng về nội dung kỹ thuật.
| Model | RAM tối thiểu | VRAM khuyến nghị | SWE-bench | Lệnh pull |
|---|---|---|---|---|
| Llama3.1:8B | 16GB | 8GB | N/A | ollama pull llama3.1:8b |
| Llama3.1:70B | 64GB+ | 32–48GB | N/A | ollama pull llama3.1:70b |
| Qwen3:14B | 32GB | 16GB | N/A | ollama pull qwen3:14b |
| Qwen3:32B | 64GB | 24–32GB | N/A | ollama pull qwen3:32b |
| GPT-OSS:20B | 48GB | 16–24GB | N/A | ollama pull gpt-oss:20b |
| GPT-OSS:120B | 128GB+ | 48–64GB | N/A | ollama pull gpt-oss:120b |
📌 Tuy nhiên, cần lưu ý Qwen3 là thế hệ mới của Qwen, cải thiện nhiều về khả năng reasoning
🧠 2. Nhóm Coding (Code generation / Debug / Refactor)
Ví dụ như, nhóm này dành cho developer cần mô hình giúp tạo code, hoàn thành hàm.
| Model | RAM tối thiểu | VRAM khuyến nghị | SWE-bench Verified | Lệnh pull |
|---|---|---|---|---|
| DeepSeek-R1 | 32GB+ | 16–24GB | ✔️ phù hợp coding thực tế | ollama pull deepseek-r1:latest |
| Qwen3-Coder:30B | 64GB | 24–32GB | ❓ không rõ SWE công khai | ollama pull qwen3-coder:30b |
| Qwen2.5-Coder:32B | 64GB | 24–32GB | ✔️ benchmark coding cực kỳ tốt | ollama pull qwen2.5-coder:32b |
| CodeLlama:13B | 32GB | 16GB | ❌ | ollama pull codellama:13b |
📌 DeepSeek-R1 hiện là một trong những model mới nhất từ DeepSeek với khả năng reasoning cao và năng lực code mạnh, phù hợp cho workflow developer hiện tại.
📌 Qwen2.5-Coder và Qwen3-Coder thuộc dòng “Coder” tối ưu cho code generation và sửa lỗi logic lớn.
🔧 3. Nhóm Agentic Coding (Sửa bug multi-file / workflow có test)
Nhóm này phù hợp khi bạn muốn mô hình tự:
• Đọc toàn bộ repo
• Xác định vấn đề
• Chỉnh sửa nhiều file
• Pass test
| Model | RAM tối thiểu | VRAM khuyến nghị | SWE-bench Verified | Lệnh pull |
|---|---|---|---|---|
| Devstral | 32GB | 16–24GB | ✔️ mạnh cho agentic workflow | ollama pull devstral |
📌 Devstral là một model được tối ưu cho các tác vụ “agentic” thực sự, tức là không chỉ code mà còn hiểu repository cấu trúc phức tạp.
📚 4. Nhóm Document / RAG / Knowledge Retrieval
Dùng để:
• Đọc tài liệu PDF
• Trích xuất nội dung
• Tổng hợp câu hỏi đáp từ tài liệu lớn
| Model | RAM tối thiểu | VRAM khuyến nghị | SWE-bench | Lệnh pull |
|---|---|---|---|---|
| Qwen3:32B | 64GB | 24–32GB | N/A | ollama pull qwen3:32b |
| Llama3.1:70B | 64GB+ | 32–48GB | N/A | ollama pull llama3.1:70b |
| GLM-4.7-Flash | 64GB | 24–32GB | N/A | ollama pull glm-4.7-flash |
📌 Mô hình như GLM-4.7-Flash đang được cộng đồng đánh giá cao cho reasoning / tool-calling trong ứng dụng enterprise.
✍️ 5. Nhóm Viết nội dung / Sáng tạo (Blog, Marketing, Storytelling)
Đây là dạng mô hình nhẹ, phản hồi nhanh nhưng vẫn giữ được ngôn ngữ tự nhiên.
| Model | RAM tối thiểu | VRAM khuyến nghị | SWE-bench | Lệnh pull |
|---|---|---|---|---|
| Llama3.1:8B | 16GB | 8GB | N/A | ollama pull llama3.1:8b |
| Qwen3:14B | 32GB | 16GB | N/A | ollama pull qwen3:14b |
| Mistral-3:14B | 32GB | 16GB | N/A | ollama pull mistral-3:14b |
📌 Mistral-3 là một trong những model nhẹ được thiết kế cho khả năng sáng tạo và hiệu năng cân bằng.
📊 Cách hiểu RAM & VRAM đúng (tóm tắt)
• RAM (bắt buộc): quyết định mô hình có load được hay không
• VRAM (tốc độ): giúp mô hình chạy nhanh hơn với GPU, đặc biệt khi offload nhiều
• Không có GPU → Ollama vẫn chạy CPU-only với RAM đủ lớn.
📦 Lệnh tải tất cả các model gợi ý
Nếu bạn muốn pull một thể tất cả các model ở trên:
ollama pull llama3.1:8b \
&& ollama pull llama3.1:70b \
&& ollama pull qwen3:14b \
&& ollama pull qwen3:32b \
&& ollama pull qwen2.5-coder:32b \
&& ollama pull deepseek-r1:latest \
&& ollama pull devstral \
&& ollama pull glm-4.7-flash \
&& ollama pull mistral-3:14b \
&& ollama pull gpt-oss:20b
📌 Tổng kết
1. Chọn model theo nhiệm vụ, không theo kích thước tham số.
2. RAM là yếu tố quyết định cho việc chạy mô hình local.
3. VRAM chỉ quyết định tốc độ và trải nghiệm GPU khi có hỗ trợ.
4. SWE-bench chỉ kèm cho mô hình phù hợp, đặc biệt coding/agentic.
Tóm lại, việc lựa chọn mô hình Ollama phụ thuộc lớn vào dung lượng VRAM thực tế trên máy của bạn.
