로컬 LLM 배포: vLLM, Quantization, 그리고 Inference — WalkSelf
4.5 (20) ⏱ 3시간 📚 30개 레슨 🎧 오디오 버전

로컬 LLM 배포: vLLM, Quantization, 그리고 Inference

대규모 언어 모델을 효율적으로 배포하고, 하드웨어 요구 사항을 줄이기 위한 Quantization 기술을 적용하며, 프로덕션 환경에서 모델을 서비스하는 방법을 배웁니다.

  • 💬 AI 강사
    어떤 강의든 질문하면 언제든 즉시 명확한 답을 받을 수 있어요.
  • 🕐 언제든지 시작
    정해진 일정이나 마감이 없어요 — 원할 때 자신의 속도로 배우세요.
  • 🌐 한국어로
    강의, 과제, 수료증까지 — 모두 완전히 당신의 언어로.

이 과정 소개

로컬 또는 프로덕션 환경에서 Large Language Models (LLMs)를 실행하는 것은 방대한 하드웨어 요구 사항과 복잡한 설정으로 인해 어려워 보일 수 있습니다. AI가 계속 진화함에 따라, 자신만의 모델을 효율적으로 호스팅하는 능력은 개발자와 운영 팀에게 필수적인 기술이 되고 있습니다. 이 과정은 LLM을 배포하고 최적화하는 과정을 세분화하여, 초보자에서 고성능 AI 모델을 효율적으로 서비스할 수 있는 전문가로 거듭나게 해줍니다. 현대적인 기술을 사용하여 메모리 사용량을 줄이고 Inference 속도를 극대화하는 방법을 탐구하며, 제한된 컴퓨팅 리소스로도 강력한 모델을 실행할 수 있도록 합니다. 학습 내용: • LLM 아키텍처, Inference 및 메모리 관리의 기본 개념을 이해합니다. • 다양한 모델 크기에 따른 하드웨어 요구 사항을 계산하고 GPU VRAM 요구량을 추정합니다. • GGUF, AWQ, GPTQ와 같은 현대적인 Quantization 방법을 적용하여 모델 가중치를 최적화합니다. • 고처리량, 저지연 Inference를 위해 vLLM을 사용하여 모델을 구성하고 배포합니다. • 표준 REST API 엔드포인트를 생성하여 로컬 모델을 애플리케이션에 원활하게 통합합니다. • 일관되고 확장 가능한 환경을 위해 Docker를 사용하여 LLM 배포를 컨테이너화하는 연습을 합니다. 이 여정은 필수적인 AI 용어와 하드웨어 기초부터 시작하여 Quantization 및 배포에 초점을 맞춘 실습형 서면 연습으로 이어집니다. 현대적인 MLOps에서 사용되는 구성 스크립트와 배포 패턴을 단계별로 학습하게 됩니다. 소프트웨어 개발자, 예비 DevOps 엔지니어, 그리고 머신러닝 경험이 없는 기술 애호가들을 위해 설계된 이 텍스트 기반 가이드는 프로그래밍 개념에 대한 기본적인 이해만 있으면 충분합니다. 지금 바로 읽기 시작하여 현대적인 AI 배포 및 Inference 최적화 기술을 쌓아보세요.

받게 되는 것

  • 📜 수료증
    LinkedIn 프로필에 추가
  • 💬 개인 AI 튜터
    강좌에서 막혔나요? 내장 튜터에게 언제든지 무엇이든 물어보세요.
  • 🎧 오디오 버전 포함
    화면 없이 어디서나 학습
  • ♾️ 평생 이용
    언제든 다시 보세요, 만료 없음
  • 📱 휴대폰 또는 컴퓨터
    어디서든 모든 기기에서
  • 💸 14일 환불
    이유 묻지 않음
  • 짧고 핵심적
    3시간의 실용 학습

리뷰 (20)

Papp Attila HU 인증된 학습자
★ 4 · 24.07.2026

Good practical walkthrough of quantization tradeoffs, though the throughput benchmarking section could use more depth.

David Osei GH 인증된 학습자
★ 5 · 19.07.2026

The quantization comparisons alone saved me hours of trial and error trying to fit a model onto my GPU.

Petre Dinu RO 인증된 학습자
★ 5 · 19.07.2026

Finally got vLLM running smoothly.

Nguyễn Văn Phát VN 인증된 학습자
★ 5 · 17.07.2026

Khóa học giải thích rất rõ cách triển khai vLLM và áp dụng quantization để giảm bộ nhớ GPU mà vẫn giữ tốc độ suy luận ổn định.

ชัยวัฒน์ รุ่งเรือง TH 인증된 학습자
★ 5 · 14.07.2026

เข้าใจ vLLM และ quantization ง่ายขึ้นมาก

Sofia Cruz PH 인증된 학습자
★ 4 · 07.07.2026

Malinaw ang paliwanag sa pag-deploy gamit ang vLLM, pero sana mas detalyado pa sa paghahambing ng GPTQ at AWQ quantization.

최시우 KR 인증된 학습자
★ 5 · 23.06.2026

vLLM 설치부터 quantization 적용까지 순서대로 따라가기만 하면 되게 구성되어 있어서 좋았습니다. 특히 AWQ와 GPTQ 방식의 차이를 실제 벤치마크로 보여주는 부분이 인상 깊었고, 덕분에 제 프로젝트에 맞는 방법을 바로 골라서 적용할 수 있었습니다.

Orhan Sönmez TR 인증된 학습자
★ 5 · 23.06.2026

vLLM ile yerel model dağıtımını ve quantization tekniklerini bu kadar net anlatan başka bir kaynak görmemiştim.

Aiman Hakim bin Mohd Yusof MY 인증된 학습자
★ 5 · 22.06.2026

Kursus ini menerangkan dengan jelas cara guna vLLM dan quantization untuk deploy LLM secara tempatan tanpa memerlukan GPU yang terlalu besar.

Tiago Martins PT 인증된 학습자
★ 4 · 18.06.2026

Bom curso, mas rápido demais no batching.

Alessandro Romano IT 인증된 학습자
★ 4 · 13.06.2026

Avevo già provato a configurare vLLM da solo un paio di volte senza grandi risultati, quindi questo corso è arrivato al momento giusto. La parte sulla quantizzazione, in particolare il confronto tra le varie tecniche per ridurre l'uso di memoria della GPU, è spiegata con esempi concreti e non solo teoria. Anche il capitolo su PagedAttention mi ha aiutato a capire perché certi modelli locali erano così lenti prima. L'unico neo è che la sezione finale sul batching dinamico va un po' di fretta e avrei voluto qualche esempio in più. Nel complesso però sono riuscito a far girare un modello locale con prestazioni decisamente migliori di prima.

Андрій Бондаренко UA 인증된 학습자
★ 4 · 11.06.2026

Брался за курс, чтобы разобраться с локальным запуском моделей без облака, и в целом цель достигнута. Тема квантизации объяснена понятно: стало ясно, как ужать модель и не угробить качество, чтобы влезть в скромную видеокарту. Развёртывание через vLLM показали по шагам, я поднял свой инференс-сервер и проверил под нагрузкой. Единственное, хотелось бы чуть глубже про мониторинг в продакшене, этот раздел показался коротковатым. Но в остальном материал плотный и применимый сразу. Для тех, кто хочет держать LLM у себя, это отличная отправная точка.

Hava Akın TR 인증된 학습자
★ 4 · 09.06.2026

Quantization kısmı çok faydalıydı ama vLLM'in production ortamına ölçeklendirilmesiyle ilgili örnekler biraz daha fazla olabilirdi.

Viviane Carvalho BR 인증된 학습자
★ 5 · 07.06.2026

O curso mostra na prática como configurar o vLLM e aplicar quantização sem transformar isso num mar de teoria abstrata. Gostei bastante de como a parte de PagedAttention foi explicada com desenhos simples que finalmente fizeram sentido pra mim. Depois de terminar consegui rodar um modelo local com uma latência bem menor do que antes.

Makeda Solomon ET 인증된 학습자
★ 4 · 02.06.2026

Practical and hands-on, though it assumes you're already comfortable with basic GPU setup before diving into vLLM.

조서윤 KR 인증된 학습자
★ 4 · 01.06.2026

평소에 로컬 LLM을 돌릴 때 GPU 메모리 문제로 계속 막혔었는데, 이 강의를 듣고 나서야 quantization이 실제로 어떻게 작동하는지 감을 잡았습니다. vLLM 설정 과정을 단계별로 따라가면서 PagedAttention 개념까지 자연스럽게 이해가 됐고, 실습 예제도 실제 배포 환경과 비슷하게 구성되어 있어서 도움이 많이 됐습니다. GPTQ와 AWQ 차이를 비교해주는 부분이 특히 유용했는데, 다만 후반부 배치 처리 최적화 설명은 조금 빠르게 지나가서 몇 번 되돌려 봐야 했습니다. 그래도 전체적으로 로컬 배포를 실무 수준으로 끌어올려주는 강의였습니다.

Endale Yosef ET 인증된 학습자
★ 4 · 01.06.2026

The walkthrough on quantizing models with AWQ actually made the memory savings click for me instead of just being a buzzword. Setting up vLLM locally went a lot smoother following the instructor's config choices than when I tried it on my own before. The only gap is the course doesn't spend much time on multi-GPU serving, which I would have liked.

Sobia Khan PK 인증된 학습자
★ 5 · 30.05.2026

Made local deployment actually make sense.

Sofia Wright AU 인증된 학습자
★ 5 · 27.05.2026

मैंने पहले vLLM को इंस्टॉल करने की कई बार कोशिश की थी लेकिन हमेशा GPU मेमोरी की दिक्कत आ जाती थी, इस कोर्स ने वो पूरी प्रक्रिया कदम दर कदम समझाई। Quantization वाले हिस्से में INT8 और INT4 के बीच का ट्रेडऑफ बहुत साफ तरीके से बताया गया, जिससे यह समझना आसान हो गया कि कब कौन सा तरीका इस्तेमाल करना चाहिए। PagedAttention का कॉन्सेप्ट पहले किताबी लगता था लेकिन यहां प्रैक्टिकल उदाहरण से समझ आ गया। सर्विंग API सेटअप करने वाला हिस्सा भी असली प्रोडक्शन जैसा फील देता है, सिर्फ थ्योरी नहीं। कुल मिलाकर अब मैं अपने खुद के मॉडल को लोकली डिप्लॉय करने में कॉन्फिडेंट महसूस करता हूं।

Samanthi Rajapakse LK 인증된 학습자
★ 4 · 26.05.2026

Dense but genuinely useful content.

리뷰 쓰기

보낸 뒤 로그인을 안내합니다 — 임시저장됩니다.

다른 학습자도 수강

자주 묻는 질문

이 과정을 듣는 데 무엇이 필요한가요? +

인터넷이 되는 휴대폰이나 컴퓨터만 있으면 됩니다. 설치나 특별한 장비는 필요 없습니다.

결제는 어떻게 하나요? +

Stripe를 통한 카드로. 카드 정보는 저장하지 않으며 Stripe가 안전하게 처리합니다.

환불받을 수 있나요? +

네 — 14일 이내 전액 환불, 이유를 묻지 않습니다.

얼마나 오래 이용할 수 있나요? +

평생. 구매하면 과정은 당신의 것이며 언제든 다시 볼 수 있습니다.

수료증을 받을 수 있나요? +

네. 수료 시 LinkedIn 프로필에 추가할 수 있는 수료증을 받습니다.

이런 분야 학습자에게
테크 디자인 금융 마케팅 의료 교육 호스피탈리티 제조업