Déploiement de LLMs locaux : vLLM, Quantization et Inference — WalkSelf
4.5 (20) ⏱ 3 h 📚 30 leçons 🎧 Version audio

Déploiement de LLMs locaux : vLLM, Quantization et Inference

Apprenez à déployer des modèles de langage de grande taille efficacement, à appliquer des techniques de Quantization pour réduire les besoins matériels et à servir des modèles dans des environnements de production.

  • 💬 Instructeur IA
    Posez une question sur n'importe quelle leçon et obtenez une réponse claire à tout moment.
  • 🕐 Commencez quand vous voulez
    Sans horaires ni délais : apprenez à votre rythme, quand vous voulez.
  • 🌐 En français
    Leçons, exercices et certificat : tout entièrement dans votre langue.

À propos de ce cours

Exécuter des Large Language Models (LLMs) localement ou en production peut sembler intimidant en raison des exigences matérielles massives et des configurations complexes. Alors que l'AI continue d'évoluer, la capacité d'héberger vos propres modèles efficacement devient une compétence essentielle pour les développeurs et les équipes opérationnelles. Ce cours décompose le processus de déploiement et d'optimisation des LLMs, vous transformant d'un débutant en quelqu'un capable de servir des modèles AI de haute performance efficacement. Vous explorerez comment réduire l'empreinte mémoire et maximiser la vitesse d'Inference en utilisant des techniques modernes, garantissant que vous pouvez exécuter des modèles puissants même avec des ressources informatiques limitées. Ce que vous apprendrez : • Comprendre les concepts fondamentaux de l'architecture LLM, de l'Inference et de la gestion de la mémoire. • Calculer les exigences matérielles et estimer les besoins en GPU VRAM pour différentes tailles de modèles. • Appliquer des méthodes de Quantization modernes comme GGUF, AWQ et GPTQ pour optimiser les poids des modèles. • Configurer et déployer des modèles en utilisant vLLM pour une Inference à haut débit et faible latence. • Créer des points de terminaison REST API standard pour intégrer de manière transparente des modèles locaux dans vos applications. • S'entraîner à la conteneurisation de vos déploiements LLM en utilisant Docker pour des environnements cohérents et évolutifs. Le voyage commence par la terminologie AI essentielle et les bases du matériel avant de passer à des exercices écrits pratiques axés sur la Quantization et le déploiement. Vous progresserez étape par étape à travers des scripts de configuration et des modèles de déploiement utilisés dans le MLOps moderne. Conçu pour les développeurs de logiciels, les futurs ingénieurs DevOps et les passionnés de technologie sans expérience préalable en machine learning, ce guide textuel ne nécessite qu'une compréhension de base des concepts de programmation. Commencez à lire dès aujourd'hui pour développer vos compétences en déploiement AI moderne et en optimisation d'Inference.

Ce que vous recevez

  • 📜 Certificat de fin
    Ajoutez-le à votre profil LinkedIn
  • 💬 Tuteur AI personnel
    Bloqué sur une leçon ? Pose n'importe quelle question à ton tuteur intégré, à tout moment.
  • 🎧 Version audio incluse
    Apprenez en déplacement, sans écran
  • ♾️ Accès à vie
    Revenez quand vous voulez, sans expiration
  • 📱 Téléphone ou ordinateur
    Fonctionne partout, sur tout appareil
  • 💸 Remboursement 14 jours
    Sans poser de questions
  • Court et ciblé
    3 h de contenu pratique

Avis (20)

Papp Attila HU Apprenant vérifié
★ 4 · 24 juillet 2026

Good practical walkthrough of quantization tradeoffs, though the throughput benchmarking section could use more depth.

David Osei GH Apprenant vérifié
★ 5 · 19 juillet 2026

The quantization comparisons alone saved me hours of trial and error trying to fit a model onto my GPU.

Petre Dinu RO Apprenant vérifié
★ 5 · 19 juillet 2026

Finally got vLLM running smoothly.

Nguyễn Văn Phát VN Apprenant vérifié
★ 5 · 17 juillet 2026

Khóa học giải thích rất rõ cách triển khai vLLM và áp dụng quantization để giảm bộ nhớ GPU mà vẫn giữ tốc độ suy luận ổn định.

ชัยวัฒน์ รุ่งเรือง TH Apprenant vérifié
★ 5 · 14 juillet 2026

เข้าใจ vLLM และ quantization ง่ายขึ้นมาก

Sofia Cruz PH Apprenant vérifié
★ 4 · 7 juillet 2026

Malinaw ang paliwanag sa pag-deploy gamit ang vLLM, pero sana mas detalyado pa sa paghahambing ng GPTQ at AWQ quantization.

최시우 KR Apprenant vérifié
★ 5 · 23 juin 2026

vLLM 설치부터 quantization 적용까지 순서대로 따라가기만 하면 되게 구성되어 있어서 좋았습니다. 특히 AWQ와 GPTQ 방식의 차이를 실제 벤치마크로 보여주는 부분이 인상 깊었고, 덕분에 제 프로젝트에 맞는 방법을 바로 골라서 적용할 수 있었습니다.

Orhan Sönmez TR Apprenant vérifié
★ 5 · 23 juin 2026

vLLM ile yerel model dağıtımını ve quantization tekniklerini bu kadar net anlatan başka bir kaynak görmemiştim.

Aiman Hakim bin Mohd Yusof MY Apprenant vérifié
★ 5 · 22 juin 2026

Kursus ini menerangkan dengan jelas cara guna vLLM dan quantization untuk deploy LLM secara tempatan tanpa memerlukan GPU yang terlalu besar.

Tiago Martins PT Apprenant vérifié
★ 4 · 18 juin 2026

Bom curso, mas rápido demais no batching.

Alessandro Romano IT Apprenant vérifié
★ 4 · 13 juin 2026

Avevo già provato a configurare vLLM da solo un paio di volte senza grandi risultati, quindi questo corso è arrivato al momento giusto. La parte sulla quantizzazione, in particolare il confronto tra le varie tecniche per ridurre l'uso di memoria della GPU, è spiegata con esempi concreti e non solo teoria. Anche il capitolo su PagedAttention mi ha aiutato a capire perché certi modelli locali erano così lenti prima. L'unico neo è che la sezione finale sul batching dinamico va un po' di fretta e avrei voluto qualche esempio in più. Nel complesso però sono riuscito a far girare un modello locale con prestazioni decisamente migliori di prima.

Андрій Бондаренко UA Apprenant vérifié
★ 4 · 11 juin 2026

Брался за курс, чтобы разобраться с локальным запуском моделей без облака, и в целом цель достигнута. Тема квантизации объяснена понятно: стало ясно, как ужать модель и не угробить качество, чтобы влезть в скромную видеокарту. Развёртывание через vLLM показали по шагам, я поднял свой инференс-сервер и проверил под нагрузкой. Единственное, хотелось бы чуть глубже про мониторинг в продакшене, этот раздел показался коротковатым. Но в остальном материал плотный и применимый сразу. Для тех, кто хочет держать LLM у себя, это отличная отправная точка.

Hava Akın TR Apprenant vérifié
★ 4 · 9 juin 2026

Quantization kısmı çok faydalıydı ama vLLM'in production ortamına ölçeklendirilmesiyle ilgili örnekler biraz daha fazla olabilirdi.

Viviane Carvalho BR Apprenant vérifié
★ 5 · 7 juin 2026

O curso mostra na prática como configurar o vLLM e aplicar quantização sem transformar isso num mar de teoria abstrata. Gostei bastante de como a parte de PagedAttention foi explicada com desenhos simples que finalmente fizeram sentido pra mim. Depois de terminar consegui rodar um modelo local com uma latência bem menor do que antes.

Makeda Solomon ET Apprenant vérifié
★ 4 · 2 juin 2026

Practical and hands-on, though it assumes you're already comfortable with basic GPU setup before diving into vLLM.

조서윤 KR Apprenant vérifié
★ 4 · 1 juin 2026

평소에 로컬 LLM을 돌릴 때 GPU 메모리 문제로 계속 막혔었는데, 이 강의를 듣고 나서야 quantization이 실제로 어떻게 작동하는지 감을 잡았습니다. vLLM 설정 과정을 단계별로 따라가면서 PagedAttention 개념까지 자연스럽게 이해가 됐고, 실습 예제도 실제 배포 환경과 비슷하게 구성되어 있어서 도움이 많이 됐습니다. GPTQ와 AWQ 차이를 비교해주는 부분이 특히 유용했는데, 다만 후반부 배치 처리 최적화 설명은 조금 빠르게 지나가서 몇 번 되돌려 봐야 했습니다. 그래도 전체적으로 로컬 배포를 실무 수준으로 끌어올려주는 강의였습니다.

Endale Yosef ET Apprenant vérifié
★ 4 · 1 juin 2026

The walkthrough on quantizing models with AWQ actually made the memory savings click for me instead of just being a buzzword. Setting up vLLM locally went a lot smoother following the instructor's config choices than when I tried it on my own before. The only gap is the course doesn't spend much time on multi-GPU serving, which I would have liked.

Sobia Khan PK Apprenant vérifié
★ 5 · 30 mai 2026

Made local deployment actually make sense.

Sofia Wright AU Apprenant vérifié
★ 5 · 27 mai 2026

मैंने पहले vLLM को इंस्टॉल करने की कई बार कोशिश की थी लेकिन हमेशा GPU मेमोरी की दिक्कत आ जाती थी, इस कोर्स ने वो पूरी प्रक्रिया कदम दर कदम समझाई। Quantization वाले हिस्से में INT8 और INT4 के बीच का ट्रेडऑफ बहुत साफ तरीके से बताया गया, जिससे यह समझना आसान हो गया कि कब कौन सा तरीका इस्तेमाल करना चाहिए। PagedAttention का कॉन्सेप्ट पहले किताबी लगता था लेकिन यहां प्रैक्टिकल उदाहरण से समझ आ गया। सर्विंग API सेटअप करने वाला हिस्सा भी असली प्रोडक्शन जैसा फील देता है, सिर्फ थ्योरी नहीं। कुल मिलाकर अब मैं अपने खुद के मॉडल को लोकली डिप्लॉय करने में कॉन्फिडेंट महसूस करता हूं।

Samanthi Rajapakse LK Apprenant vérifié
★ 4 · 26 mai 2026

Dense but genuinely useful content.

Écrire un avis

Nous vous demanderons de vous connecter après envoi — votre brouillon est sauvegardé.

Autres apprenants ont aussi suivi

Questions fréquentes

De quoi ai-je besoin pour suivre ce cours ? +

Un téléphone ou un ordinateur avec internet, c'est tout. Aucune installation, aucun matériel spécial.

Comment payer ? +

Par carte via Stripe. Nous ne stockons pas les données de carte — Stripe les gère de manière sécurisée.

Puis-je obtenir un remboursement ? +

Oui — remboursement complet sous 14 jours, sans question.

Combien de temps aurai-je accès ? +

À vie. Une fois acheté, le cours est à vous, vous pouvez y revenir quand vous voulez.

Vais-je obtenir un certificat ? +

Oui. À la fin, vous recevez un certificat à ajouter à votre profil LinkedIn.

Conçu pour les apprenants en
Tech Design Finance Marketing Santé Éducation Hôtellerie Industrie