Pag-deploy ng mga Local LLM: vLLM, Quantization, at Inference — WalkSelf
4.5 (20) ⏱ 3 oras 📚 30 aralin 🎧 Audio version

Pag-deploy ng mga Local LLM: vLLM, Quantization, at Inference

Alamin kung paano mag-deploy ng mga large language model nang mahusay, mag-apply ng mga quantization technique para mabawasan ang mga hardware requirement, at mag-serve ng mga model sa mga production environment.

  • 💬 AI instructor
    Magtanong tungkol sa anumang aralin at makakuha ng malinaw na sagot agad, anumang oras.
  • 🕐 Magsimula anumang oras
    Walang iskedyul o deadline — mag-aral sa sarili mong bilis, kahit kailan.
  • 🌐 Sa Filipino
    Mga aralin, gawain at sertipiko — lahat ay ganap na nasa wika mo.

Tungkol sa kursong ito

Ang pagpapatakbo ng mga Large Language Models (LLMs) nang lokal o sa production ay maaaring magmukhang nakakatakot dahil sa malalaking hardware requirement at kumplikadong configuration. Habang patuloy na nag-e-evolve ang AI, ang kakayahang mag-host ng sarili mong mga model nang mahusay ay nagiging isang mahalagang kasanayan para sa mga developer at operations team. Hinihimay ng kursong ito ang proseso ng pag-deploy at pag-optimize ng mga LLM, na nagbabago sa iyo mula sa isang beginner tungo sa isang taong may kakayahang mag-serve ng mga high-performance na AI model nang mahusay. I-e-explore mo kung paano bawasan ang memory footprint at i-maximize ang inference speed gamit ang mga modernong technique, na tinitiyak na mapapatakbo mo ang mga makapangyarihang model kahit na may limitadong computational resource. Ang iyong matututuhan: • Unawain ang mga pangunahing konsepto ng LLM architecture, inference, at memory management. • Mag-calculate ng mga hardware requirement at mag-estimate ng mga GPU VRAM need para sa iba't ibang laki ng model. • Mag-apply ng mga modernong quantization method tulad ng GGUF, AWQ, at GPTQ para i-optimize ang mga model weight. • I-configure at i-deploy ang mga model gamit ang vLLM para sa high-throughput, low-latency na inference. • Gumawa ng mga standard na REST API endpoint para ma-integrate nang maayos ang mga local model sa iyong mga application. • Mag-practice ng pag-containerize ng iyong mga LLM deployment gamit ang Docker para sa mga consistent at scalable na environment. Magsisimula ang paglalakbay sa mahahalagang AI terminology at hardware basics bago lumipat sa mga hands-on na written exercise na nakatuon sa quantization at deployment. Magpapatuloy ka nang step-by-step sa pamamagitan ng mga configuration script at deployment pattern na ginagamit sa modernong MLOps. Idinisenyo para sa mga software developer, mga nagnanais maging DevOps engineer, at mga tech enthusiast na walang naunang karanasan sa machine learning, ang text-based na gabay na ito ay nangangailangan lamang ng pangunahing pag-unawa sa mga konsepto ng programming. Simulan ang pagbabasa ngayon para mabuo ang iyong mga kasanayan sa modernong AI deployment at inference optimization.

Ang makukuha mo

  • 📜 Certificate ng pagtatapos
    Idagdag sa LinkedIn profile mo
  • 💬 Personal na AI tutor
    Natigil sa isang aralin? Itanong sa iyong built-in na tutor ang kahit ano, kahit kailan.
  • 🎧 Kasama ang audio version
    Mag-aral kahit saan — hindi kailangan ng screen
  • ♾️ Lifetime access
    Bumalik anumang oras, walang expiry
  • 📱 Telepono o computer
    Gumagana saanman, kahit anong device
  • 💸 14-day refund
    Walang tanong
  • Maikli at focused
    3 oras ng practical content

Mga review (20)

Papp Attila HU Verified learner
★ 4 · 24.07.2026

Good practical walkthrough of quantization tradeoffs, though the throughput benchmarking section could use more depth.

David Osei GH Verified learner
★ 5 · 19.07.2026

The quantization comparisons alone saved me hours of trial and error trying to fit a model onto my GPU.

Petre Dinu RO Verified learner
★ 5 · 19.07.2026

Finally got vLLM running smoothly.

Nguyễn Văn Phát VN Verified learner
★ 5 · 17.07.2026

Khóa học giải thích rất rõ cách triển khai vLLM và áp dụng quantization để giảm bộ nhớ GPU mà vẫn giữ tốc độ suy luận ổn định.

ชัยวัฒน์ รุ่งเรือง TH Verified learner
★ 5 · 14.07.2026

เข้าใจ vLLM และ quantization ง่ายขึ้นมาก

Sofia Cruz PH Verified learner
★ 4 · 07.07.2026

Malinaw ang paliwanag sa pag-deploy gamit ang vLLM, pero sana mas detalyado pa sa paghahambing ng GPTQ at AWQ quantization.

최시우 KR Verified learner
★ 5 · 23.06.2026

vLLM 설치부터 quantization 적용까지 순서대로 따라가기만 하면 되게 구성되어 있어서 좋았습니다. 특히 AWQ와 GPTQ 방식의 차이를 실제 벤치마크로 보여주는 부분이 인상 깊었고, 덕분에 제 프로젝트에 맞는 방법을 바로 골라서 적용할 수 있었습니다.

Orhan Sönmez TR Verified learner
★ 5 · 23.06.2026

vLLM ile yerel model dağıtımını ve quantization tekniklerini bu kadar net anlatan başka bir kaynak görmemiştim.

Aiman Hakim bin Mohd Yusof MY Verified learner
★ 5 · 22.06.2026

Kursus ini menerangkan dengan jelas cara guna vLLM dan quantization untuk deploy LLM secara tempatan tanpa memerlukan GPU yang terlalu besar.

Tiago Martins PT Verified learner
★ 4 · 18.06.2026

Bom curso, mas rápido demais no batching.

Alessandro Romano IT Verified learner
★ 4 · 13.06.2026

Avevo già provato a configurare vLLM da solo un paio di volte senza grandi risultati, quindi questo corso è arrivato al momento giusto. La parte sulla quantizzazione, in particolare il confronto tra le varie tecniche per ridurre l'uso di memoria della GPU, è spiegata con esempi concreti e non solo teoria. Anche il capitolo su PagedAttention mi ha aiutato a capire perché certi modelli locali erano così lenti prima. L'unico neo è che la sezione finale sul batching dinamico va un po' di fretta e avrei voluto qualche esempio in più. Nel complesso però sono riuscito a far girare un modello locale con prestazioni decisamente migliori di prima.

Андрій Бондаренко UA Verified learner
★ 4 · 11.06.2026

Брался за курс, чтобы разобраться с локальным запуском моделей без облака, и в целом цель достигнута. Тема квантизации объяснена понятно: стало ясно, как ужать модель и не угробить качество, чтобы влезть в скромную видеокарту. Развёртывание через vLLM показали по шагам, я поднял свой инференс-сервер и проверил под нагрузкой. Единственное, хотелось бы чуть глубже про мониторинг в продакшене, этот раздел показался коротковатым. Но в остальном материал плотный и применимый сразу. Для тех, кто хочет держать LLM у себя, это отличная отправная точка.

Hava Akın TR Verified learner
★ 4 · 09.06.2026

Quantization kısmı çok faydalıydı ama vLLM'in production ortamına ölçeklendirilmesiyle ilgili örnekler biraz daha fazla olabilirdi.

Viviane Carvalho BR Verified learner
★ 5 · 07.06.2026

O curso mostra na prática como configurar o vLLM e aplicar quantização sem transformar isso num mar de teoria abstrata. Gostei bastante de como a parte de PagedAttention foi explicada com desenhos simples que finalmente fizeram sentido pra mim. Depois de terminar consegui rodar um modelo local com uma latência bem menor do que antes.

Makeda Solomon ET Verified learner
★ 4 · 02.06.2026

Practical and hands-on, though it assumes you're already comfortable with basic GPU setup before diving into vLLM.

조서윤 KR Verified learner
★ 4 · 01.06.2026

평소에 로컬 LLM을 돌릴 때 GPU 메모리 문제로 계속 막혔었는데, 이 강의를 듣고 나서야 quantization이 실제로 어떻게 작동하는지 감을 잡았습니다. vLLM 설정 과정을 단계별로 따라가면서 PagedAttention 개념까지 자연스럽게 이해가 됐고, 실습 예제도 실제 배포 환경과 비슷하게 구성되어 있어서 도움이 많이 됐습니다. GPTQ와 AWQ 차이를 비교해주는 부분이 특히 유용했는데, 다만 후반부 배치 처리 최적화 설명은 조금 빠르게 지나가서 몇 번 되돌려 봐야 했습니다. 그래도 전체적으로 로컬 배포를 실무 수준으로 끌어올려주는 강의였습니다.

Endale Yosef ET Verified learner
★ 4 · 01.06.2026

The walkthrough on quantizing models with AWQ actually made the memory savings click for me instead of just being a buzzword. Setting up vLLM locally went a lot smoother following the instructor's config choices than when I tried it on my own before. The only gap is the course doesn't spend much time on multi-GPU serving, which I would have liked.

Sobia Khan PK Verified learner
★ 5 · 30.05.2026

Made local deployment actually make sense.

Sofia Wright AU Verified learner
★ 5 · 27.05.2026

मैंने पहले vLLM को इंस्टॉल करने की कई बार कोशिश की थी लेकिन हमेशा GPU मेमोरी की दिक्कत आ जाती थी, इस कोर्स ने वो पूरी प्रक्रिया कदम दर कदम समझाई। Quantization वाले हिस्से में INT8 और INT4 के बीच का ट्रेडऑफ बहुत साफ तरीके से बताया गया, जिससे यह समझना आसान हो गया कि कब कौन सा तरीका इस्तेमाल करना चाहिए। PagedAttention का कॉन्सेप्ट पहले किताबी लगता था लेकिन यहां प्रैक्टिकल उदाहरण से समझ आ गया। सर्विंग API सेटअप करने वाला हिस्सा भी असली प्रोडक्शन जैसा फील देता है, सिर्फ थ्योरी नहीं। कुल मिलाकर अब मैं अपने खुद के मॉडल को लोकली डिप्लॉय करने में कॉन्फिडेंट महसूस करता हूं।

Samanthi Rajapakse LK Verified learner
★ 4 · 26.05.2026

Dense but genuinely useful content.

Magsulat ng review

Hihilingin naming mag-sign in ka pagkatapos — ligtas ang draft mo.

Kinuha rin ng iba

Mga madalas itanong

Ano ang kailangan ko para sa kursong ito? +

Telepono o computer na may internet lang. Walang install, walang special hardware.

Paano ako magbabayad? +

Sa pamamagitan ng card via Stripe. Hindi namin iniimbak ang detalye ng card — secure na hinahawakan ng Stripe.

Pwede ba akong mag-refund? +

Oo — full refund sa loob ng 14 araw, walang tanong.

Hanggang kailan ang access ko? +

Habang buhay. Sa pagbili, sa iyo na ang course — balikan mo kahit kailan.

Makakakuha ba ako ng certificate? +

Oo. Pagkatapos, makakatanggap ka ng certificate na maidadagdag sa LinkedIn profile mo.

Para sa mga learner sa
Tech Design Finance Marketing Healthcare Edukasyon Hospitality Manufacturing