Tổng hợp các mô hình Ollama mới nhất – Phân loại theo mục đích sử dụng + RAM/VRAM + SWE-bench

February 11, 2026

Ollama hiện là một trong những nền tảng mạnh nhất để chạy mô hình ngôn ngữ lớn (LLM) tại chỗ (local), không phụ thuộc API bên ngoài và giữ toàn quyền dữ liệu.  

Tuy nhiên, việc chọn mô hình đúng nhu cầu vẫn còn khó khăn nếu không có bảng so sánh rõ ràng.

Trong bài này, chúng ta sẽ:

✅ Phân loại mô hình theo mục đích sử dụng

✅ Cho biết RAM và VRAM cần thiết

✅ Kèm lệnh ollama pull cho từng mô hình

✅ Chỉ đi kèm SWE-bench Verified với model thật sự phù hợp

🚀 1. Nhóm Chat tổng quát (General Chat / QA / reasoning)

Nhóm này phù hợp cho các tác vụ như:

• Trò chuyện tự nhiên

• Hỏi đáp đơn giản

• Tổng hợp ý tưởng

• Phân tích kiến thức chung

Mục tiêu là phản hồi mạch lạc, ổn định, không quá nặng về nội dung kỹ thuật.

ModelRAM tối thiểuVRAM khuyến nghịSWE-benchLệnh pull
Llama3.1:8B16GB8GBN/Aollama pull llama3.1:8b
Llama3.1:70B64GB+32–48GBN/Aollama pull llama3.1:70b
Qwen3:14B32GB16GBN/Aollama pull qwen3:14b
Qwen3:32B64GB24–32GBN/Aollama pull qwen3:32b
GPT-OSS:20B48GB16–24GBN/Aollama pull gpt-oss:20b
GPT-OSS:120B128GB+48–64GBN/Aollama pull gpt-oss:120b

📌 Tuy nhiên, cần lưu ý Qwen3 là thế hệ mới của Qwen, cải thiện nhiều về khả năng reasoning  

🧠 2. Nhóm Coding (Code generation / Debug / Refactor)

Ví dụ như, nhóm này dành cho developer cần mô hình giúp tạo code, hoàn thành hàm.

ModelRAM tối thiểuVRAM khuyến nghịSWE-bench VerifiedLệnh pull
DeepSeek-R132GB+16–24GB✔️ phù hợp coding thực tếollama pull deepseek-r1:latest
Qwen3-Coder:30B64GB24–32GB❓ không rõ SWE công khaiollama pull qwen3-coder:30b
Qwen2.5-Coder:32B64GB24–32GB✔️ benchmark coding cực kỳ tốtollama pull qwen2.5-coder:32b
CodeLlama:13B32GB16GBollama pull codellama:13b

📌 DeepSeek-R1 hiện là một trong những model mới nhất từ DeepSeek với khả năng reasoning cao và năng lực code mạnh, phù hợp cho workflow developer hiện tại.  

📌 Qwen2.5-Coder và Qwen3-Coder thuộc dòng “Coder” tối ưu cho code generation và sửa lỗi logic lớn.

🔧 3. Nhóm Agentic Coding (Sửa bug multi-file / workflow có test)

Nhóm này phù hợp khi bạn muốn mô hình tự:

• Đọc toàn bộ repo

• Xác định vấn đề

• Chỉnh sửa nhiều file

• Pass test

ModelRAM tối thiểuVRAM khuyến nghịSWE-bench VerifiedLệnh pull
Devstral32GB16–24GB✔️ mạnh cho agentic workflowollama pull devstral

📌 Devstral là một model được tối ưu cho các tác vụ “agentic” thực sự, tức là không chỉ code mà còn hiểu repository cấu trúc phức tạp.

📚 4. Nhóm Document / RAG / Knowledge Retrieval

Dùng để:

• Đọc tài liệu PDF

• Trích xuất nội dung

• Tổng hợp câu hỏi đáp từ tài liệu lớn

ModelRAM tối thiểuVRAM khuyến nghịSWE-benchLệnh pull
Qwen3:32B64GB24–32GBN/Aollama pull qwen3:32b
Llama3.1:70B64GB+32–48GBN/Aollama pull llama3.1:70b
GLM-4.7-Flash64GB24–32GBN/Aollama pull glm-4.7-flash

📌 Mô hình như GLM-4.7-Flash đang được cộng đồng đánh giá cao cho reasoning / tool-calling trong ứng dụng enterprise.  

✍️ 5. Nhóm Viết nội dung / Sáng tạo (Blog, Marketing, Storytelling)

Đây là dạng mô hình nhẹ, phản hồi nhanh nhưng vẫn giữ được ngôn ngữ tự nhiên.

ModelRAM tối thiểuVRAM khuyến nghịSWE-benchLệnh pull
Llama3.1:8B16GB8GBN/Aollama pull llama3.1:8b
Qwen3:14B32GB16GBN/Aollama pull qwen3:14b
Mistral-3:14B32GB16GBN/Aollama pull mistral-3:14b

📌 Mistral-3 là một trong những model nhẹ được thiết kế cho khả năng sáng tạo và hiệu năng cân bằng.  

📊 Cách hiểu RAM & VRAM đúng (tóm tắt)

RAM (bắt buộc): quyết định mô hình có load được hay không

VRAM (tốc độ): giúp mô hình chạy nhanh hơn với GPU, đặc biệt khi offload nhiều

• Không có GPU → Ollama vẫn chạy CPU-only với RAM đủ lớn.  

📦 Lệnh tải tất cả các model gợi ý

Nếu bạn muốn pull một thể tất cả các model ở trên:

ollama pull llama3.1:8b \

&& ollama pull llama3.1:70b \

&& ollama pull qwen3:14b \

&& ollama pull qwen3:32b \

&& ollama pull qwen2.5-coder:32b \

&& ollama pull deepseek-r1:latest \

&& ollama pull devstral \

&& ollama pull glm-4.7-flash \

&& ollama pull mistral-3:14b \

&& ollama pull gpt-oss:20b

📌 Tổng kết

1. Chọn model theo nhiệm vụ, không theo kích thước tham số.

2. RAM là yếu tố quyết định cho việc chạy mô hình local.

3. VRAM chỉ quyết định tốc độ và trải nghiệm GPU khi có hỗ trợ.

4. SWE-bench chỉ kèm cho mô hình phù hợp, đặc biệt coding/agentic.

Tóm lại, việc lựa chọn mô hình Ollama phụ thuộc lớn vào dung lượng VRAM thực tế trên máy của bạn.