Triển khai LLM cục bộ: vLLM, Quantization, và Inference — WalkSelf
4.5 (20) ⏱ 3 giờ 📚 30 bài 🎧 Phiên bản âm thanh

Triển khai LLM cục bộ: vLLM, Quantization, và Inference

Tìm hiểu cách triển khai các mô hình ngôn ngữ lớn một cách hiệu quả, áp dụng các kỹ thuật quantization để giảm yêu cầu phần cứng và phục vụ các mô hình trong môi trường production.

  • 💬 Giảng viên AI
    Hỏi về bất kỳ bài học nào và nhận câu trả lời rõ ràng ngay lập tức, mọi lúc.
  • 🕐 Bắt đầu bất cứ lúc nào
    Không lịch trình hay hạn chót — học theo nhịp của bạn, bất cứ khi nào.
  • 🌐 Bằng tiếng Việt
    Bài học, bài tập và chứng chỉ — tất cả hoàn toàn bằng ngôn ngữ của bạn.

Về khóa học này

Việc chạy các Mô hình Ngôn ngữ Lớn (LLM) cục bộ hoặc trong production có vẻ khó khăn do yêu cầu phần cứng khổng lồ và cấu hình phức tạp. Khi AI tiếp tục phát triển, khả năng tự host các mô hình của riêng bạn một cách hiệu quả đang trở thành một kỹ năng thiết yếu cho các nhà phát triển và đội ngũ vận hành. Khóa học này chia nhỏ quy trình triển khai và tối ưu hóa LLM, giúp bạn từ một người mới bắt đầu trở thành người có khả năng phục vụ các mô hình AI hiệu suất cao một cách hiệu quả. Bạn sẽ khám phá cách giảm dung lượng bộ nhớ và tối đa hóa tốc độ inference bằng các kỹ thuật hiện đại, đảm bảo bạn có thể chạy các mô hình mạnh mẽ ngay cả với tài nguyên tính toán hạn chế. Những gì bạn sẽ học: • Hiểu các khái niệm nền tảng về kiến trúc LLM, inference và quản lý bộ nhớ. • Tính toán yêu cầu phần cứng và ước tính nhu cầu GPU VRAM cho các kích thước mô hình khác nhau. • Áp dụng các phương pháp quantization hiện đại như GGUF, AWQ và GPTQ để tối ưu hóa trọng số mô hình. • Cấu hình và triển khai các mô hình bằng vLLM để có inference thông lượng cao, độ trễ thấp. • Tạo các endpoint REST API tiêu chuẩn để tích hợp liền mạch các mô hình cục bộ vào ứng dụng của bạn. • Thực hành container hóa các triển khai LLM của bạn bằng Docker để có môi trường nhất quán, có thể mở rộng. Hành trình bắt đầu với các thuật ngữ AI thiết yếu và kiến thức cơ bản về phần cứng trước khi chuyển sang các bài tập viết thực hành tập trung vào quantization và triển khai. Bạn sẽ tiến triển từng bước thông qua các script cấu hình và các mẫu triển khai được sử dụng trong MLOps hiện đại. Được thiết kế cho các nhà phát triển phần mềm, các kỹ sư DevOps đầy tham vọng và những người đam mê công nghệ chưa có kinh nghiệm về machine learning trước đó, hướng dẫn dựa trên văn bản này chỉ yêu cầu hiểu biết cơ bản về các khái niệm lập trình. Hãy bắt đầu đọc ngay hôm nay để xây dựng kỹ năng của bạn trong việc triển khai AI hiện đại và tối ưu hóa inference.

Bạn sẽ nhận được

  • 📜 Chứng chỉ hoàn thành
    Thêm vào hồ sơ LinkedIn
  • 💬 Gia sư AI cá nhân
    Bí ở một bài học? Hỏi gia sư tích hợp của bạn bất cứ điều gì, bất cứ lúc nào.
  • 🎧 Bao gồm phiên bản âm thanh
    Học mọi lúc mọi nơi — không cần màn hình
  • ♾️ Truy cập trọn đời
    Quay lại bất cứ lúc nào, không hết hạn
  • 📱 Điện thoại hoặc máy tính
    Hoạt động mọi nơi, mọi thiết bị
  • 💸 Hoàn tiền 14 ngày
    Không cần lý do
  • Ngắn gọn, đi vào trọng tâm
    3 giờ nội dung thực hành

Đánh giá (20)

Papp Attila HU Học viên đã xác minh
★ 4 · 24.07.2026

Good practical walkthrough of quantization tradeoffs, though the throughput benchmarking section could use more depth.

David Osei GH Học viên đã xác minh
★ 5 · 19.07.2026

The quantization comparisons alone saved me hours of trial and error trying to fit a model onto my GPU.

Petre Dinu RO Học viên đã xác minh
★ 5 · 19.07.2026

Finally got vLLM running smoothly.

Nguyễn Văn Phát VN Học viên đã xác minh
★ 5 · 17.07.2026

Khóa học giải thích rất rõ cách triển khai vLLM và áp dụng quantization để giảm bộ nhớ GPU mà vẫn giữ tốc độ suy luận ổn định.

ชัยวัฒน์ รุ่งเรือง TH Học viên đã xác minh
★ 5 · 14.07.2026

เข้าใจ vLLM และ quantization ง่ายขึ้นมาก

Sofia Cruz PH Học viên đã xác minh
★ 4 · 07.07.2026

Malinaw ang paliwanag sa pag-deploy gamit ang vLLM, pero sana mas detalyado pa sa paghahambing ng GPTQ at AWQ quantization.

최시우 KR Học viên đã xác minh
★ 5 · 23.06.2026

vLLM 설치부터 quantization 적용까지 순서대로 따라가기만 하면 되게 구성되어 있어서 좋았습니다. 특히 AWQ와 GPTQ 방식의 차이를 실제 벤치마크로 보여주는 부분이 인상 깊었고, 덕분에 제 프로젝트에 맞는 방법을 바로 골라서 적용할 수 있었습니다.

Orhan Sönmez TR Học viên đã xác minh
★ 5 · 23.06.2026

vLLM ile yerel model dağıtımını ve quantization tekniklerini bu kadar net anlatan başka bir kaynak görmemiştim.

Aiman Hakim bin Mohd Yusof MY Học viên đã xác minh
★ 5 · 22.06.2026

Kursus ini menerangkan dengan jelas cara guna vLLM dan quantization untuk deploy LLM secara tempatan tanpa memerlukan GPU yang terlalu besar.

Tiago Martins PT Học viên đã xác minh
★ 4 · 18.06.2026

Bom curso, mas rápido demais no batching.

Alessandro Romano IT Học viên đã xác minh
★ 4 · 13.06.2026

Avevo già provato a configurare vLLM da solo un paio di volte senza grandi risultati, quindi questo corso è arrivato al momento giusto. La parte sulla quantizzazione, in particolare il confronto tra le varie tecniche per ridurre l'uso di memoria della GPU, è spiegata con esempi concreti e non solo teoria. Anche il capitolo su PagedAttention mi ha aiutato a capire perché certi modelli locali erano così lenti prima. L'unico neo è che la sezione finale sul batching dinamico va un po' di fretta e avrei voluto qualche esempio in più. Nel complesso però sono riuscito a far girare un modello locale con prestazioni decisamente migliori di prima.

Андрій Бондаренко UA Học viên đã xác minh
★ 4 · 11.06.2026

Брался за курс, чтобы разобраться с локальным запуском моделей без облака, и в целом цель достигнута. Тема квантизации объяснена понятно: стало ясно, как ужать модель и не угробить качество, чтобы влезть в скромную видеокарту. Развёртывание через vLLM показали по шагам, я поднял свой инференс-сервер и проверил под нагрузкой. Единственное, хотелось бы чуть глубже про мониторинг в продакшене, этот раздел показался коротковатым. Но в остальном материал плотный и применимый сразу. Для тех, кто хочет держать LLM у себя, это отличная отправная точка.

Hava Akın TR Học viên đã xác minh
★ 4 · 09.06.2026

Quantization kısmı çok faydalıydı ama vLLM'in production ortamına ölçeklendirilmesiyle ilgili örnekler biraz daha fazla olabilirdi.

Viviane Carvalho BR Học viên đã xác minh
★ 5 · 07.06.2026

O curso mostra na prática como configurar o vLLM e aplicar quantização sem transformar isso num mar de teoria abstrata. Gostei bastante de como a parte de PagedAttention foi explicada com desenhos simples que finalmente fizeram sentido pra mim. Depois de terminar consegui rodar um modelo local com uma latência bem menor do que antes.

Makeda Solomon ET Học viên đã xác minh
★ 4 · 02.06.2026

Practical and hands-on, though it assumes you're already comfortable with basic GPU setup before diving into vLLM.

조서윤 KR Học viên đã xác minh
★ 4 · 01.06.2026

평소에 로컬 LLM을 돌릴 때 GPU 메모리 문제로 계속 막혔었는데, 이 강의를 듣고 나서야 quantization이 실제로 어떻게 작동하는지 감을 잡았습니다. vLLM 설정 과정을 단계별로 따라가면서 PagedAttention 개념까지 자연스럽게 이해가 됐고, 실습 예제도 실제 배포 환경과 비슷하게 구성되어 있어서 도움이 많이 됐습니다. GPTQ와 AWQ 차이를 비교해주는 부분이 특히 유용했는데, 다만 후반부 배치 처리 최적화 설명은 조금 빠르게 지나가서 몇 번 되돌려 봐야 했습니다. 그래도 전체적으로 로컬 배포를 실무 수준으로 끌어올려주는 강의였습니다.

Endale Yosef ET Học viên đã xác minh
★ 4 · 01.06.2026

The walkthrough on quantizing models with AWQ actually made the memory savings click for me instead of just being a buzzword. Setting up vLLM locally went a lot smoother following the instructor's config choices than when I tried it on my own before. The only gap is the course doesn't spend much time on multi-GPU serving, which I would have liked.

Sobia Khan PK Học viên đã xác minh
★ 5 · 30.05.2026

Made local deployment actually make sense.

Sofia Wright AU Học viên đã xác minh
★ 5 · 27.05.2026

मैंने पहले vLLM को इंस्टॉल करने की कई बार कोशिश की थी लेकिन हमेशा GPU मेमोरी की दिक्कत आ जाती थी, इस कोर्स ने वो पूरी प्रक्रिया कदम दर कदम समझाई। Quantization वाले हिस्से में INT8 और INT4 के बीच का ट्रेडऑफ बहुत साफ तरीके से बताया गया, जिससे यह समझना आसान हो गया कि कब कौन सा तरीका इस्तेमाल करना चाहिए। PagedAttention का कॉन्सेप्ट पहले किताबी लगता था लेकिन यहां प्रैक्टिकल उदाहरण से समझ आ गया। सर्विंग API सेटअप करने वाला हिस्सा भी असली प्रोडक्शन जैसा फील देता है, सिर्फ थ्योरी नहीं। कुल मिलाकर अब मैं अपने खुद के मॉडल को लोकली डिप्लॉय करने में कॉन्फिडेंट महसूस करता हूं।

Samanthi Rajapakse LK Học viên đã xác minh
★ 4 · 26.05.2026

Dense but genuinely useful content.

Viết đánh giá

Sau khi gửi, chúng tôi sẽ yêu cầu đăng nhập — bản nháp được lưu.

Học viên cũng học

Câu hỏi thường gặp

Tôi cần gì để học khóa này? +

Chỉ cần điện thoại hoặc máy tính có kết nối internet. Không cần cài đặt hay thiết bị đặc biệt.

Tôi thanh toán bằng cách nào? +

Bằng thẻ qua Stripe. Chúng tôi không lưu thông tin thẻ — Stripe xử lý an toàn.

Tôi có thể được hoàn tiền không? +

Có — hoàn tiền đầy đủ trong 14 ngày, không cần lý do.

Tôi sẽ có quyền truy cập trong bao lâu? +

Mãi mãi. Sau khi mua, khóa học là của bạn để xem lại bất cứ lúc nào.

Tôi có nhận được chứng chỉ không? +

Có. Sau khi hoàn thành, bạn sẽ nhận được chứng chỉ và có thể thêm vào hồ sơ LinkedIn.

Dành cho người học trong
Công nghệ Thiết kế Tài chính Marketing Y tế Giáo dục Khách sạn-Dịch vụ Sản xuất