Xây dựng ứng dụng AI đa phương thức: Speech-to-Text và LLMs — WalkSelf
4.6 (12) ⏱ 2 giờ 42 phút 📚 27 bài

Xây dựng ứng dụng AI đa phương thức: Speech-to-Text và LLMs

Hướng dẫn thân thiện với người mới bắt đầu dành cho các nhà phát triển để tích hợp nhận dạng giọng nói, phân tích hình ảnh và các LLMs đa phương thức vào các ứng dụng hiện đại bằng cách sử dụng các API tiêu chuẩn và các mô hình AI hiện nay.

  • 💬 Giảng viên AI
    Hỏi về bất kỳ bài học nào và nhận câu trả lời rõ ràng ngay lập tức, mọi lúc.
  • 🕐 Bắt đầu bất cứ lúc nào
    Không lịch trình hay hạn chót — học theo nhịp của bạn, bất cứ khi nào.
  • 🌐 Bằng tiếng Việt
    Bài học, bài tập và chứng chỉ — tất cả hoàn toàn bằng ngôn ngữ của bạn.

Về khóa học này

Các ứng dụng hiện đại đang tiến xa hơn văn bản đơn thuần. Bằng cách tích hợp các khả năng xử lý giọng nói, hình ảnh và video, các nhà phát triển có thể tạo ra các trải nghiệm người dùng có tính tương tác cao và thông minh. Khóa học này cung cấp kiến thức nền tảng về các Mô hình Ngôn ngữ Lớn (LLMs) đa phương thức và công nghệ speech-to-text. Bạn sẽ học cách viết mã để tương tác với các mô hình AI nhằm chuyển đổi âm thanh thành văn bản, phân tích dữ liệu hình ảnh và tạo ra các phản hồi thông minh, biến các ứng dụng tiêu chuẩn thành các công cụ mạnh mẽ được thúc đẩy bởi AI. Những gì bạn sẽ học: Hiểu các khái niệm cốt lõi về AI đa phương thức và cách các mô hình xử lý các loại dữ liệu khác nhau; Viết mã để tích hợp các API speech-to-text để chuyển đổi âm thanh chính xác; Xử lý và phân tích hình ảnh và khung hình video bằng các khả năng LLM hiện đại; Áp dụng các kỹ thuật prompt engineering cơ bản được điều chỉnh cho các đầu vào đa phương thức; Triển khai các mô hình Retrieval-Augmented Generation (RAG) cơ bản cho phương tiện truyền thông phong phú; Xây dựng các kịch bản dựa trên văn bản để điều phối các quy trình làm việc AI phức tạp một cách liền mạch. Chương trình học bắt đầu với các thuật ngữ AI thiết yếu và các khái niệm nền tảng trước khi chuyển sang tích hợp API thực tế và xử lý dữ liệu. Bạn sẽ tiến bộ thông qua các bài học viết có cấu trúc và các đoạn mã giúp xây dựng sự tự tin của bạn trong việc xử lý các loại phương tiện khác nhau bằng lập trình. Khóa học này được thiết kế cho các nhà phát triển mới bắt đầu và các kỹ sư fullstack đang muốn bước vào lĩnh vực AI mà không yêu cầu kinh nghiệm về machine learning trước đó. Hãy bắt đầu đọc ngay hôm nay để mở khóa tiềm năng của AI đa phương thức trong dự án phát triển tiếp theo của bạn.

Bạn sẽ nhận được

  • 📜 Chứng chỉ hoàn thành
    Thêm vào hồ sơ LinkedIn
  • 💬 Gia sư AI cá nhân
    Bí ở một bài học? Hỏi gia sư tích hợp của bạn bất cứ điều gì, bất cứ lúc nào.
  • ♾️ Truy cập trọn đời
    Quay lại bất cứ lúc nào, không hết hạn
  • 📱 Điện thoại hoặc máy tính
    Hoạt động mọi nơi, mọi thiết bị
  • 💸 Hoàn tiền 14 ngày
    Không cần lý do
  • Ngắn gọn, đi vào trọng tâm
    2 giờ 42 phút nội dung thực hành

Đánh giá (12)

مريم بنت أحمد بن راشد آل ثاني QA Học viên đã xác minh
★ 4 · 24.07.2026

شرح جيد لكن سريع بعض الشيء.

Henry Walker AU
★ 4 · 24.07.2026

Nice walkthrough of hooking speech-to-text into an LLM pipeline, though the image portion feels a bit rushed compared to the audio section.

Esi Adu GH Học viên đã xác minh
★ 5 · 15.07.2026

Really practical intro to combining speech-to-text with an LLM, and the pacing between audio and image sections feels well balanced.

Renata Flores UY
★ 5 · 14.07.2026

Me sorprendió lo accesible que resulta combinar reconocimiento de voz con un modelo de lenguaje después de este curso. Va construyendo la app multimodal pieza por pieza, primero el audio, luego cómo pasarlo al LLM, y se entiende perfectamente incluso sin experiencia previa en IA.

Fernanda Mendes BR
★ 5 · 07.07.2026

O curso mostra bem como conectar reconhecimento de fala a um LLM para montar um app multimodal do zero. Gostei especialmente da parte prática, onde você grava um áudio e vê o modelo respondendo em tempo real.

Pablo Ruiz ES Học viên đã xác minh
★ 4 · 02.07.2026

Bien explicado, aunque algo denso al final.

Hava Akın TR
★ 4 · 29.06.2026

Ses tanıma kısmı gerçekten iyi anlatılmış.

Lina Marlina ID
★ 5 · 28.06.2026

Panduan integrasi speech-to-text dan LLM-nya sangat mudah diikuti untuk pemula, langsung praktik bikin fitur multimodal dari awal.

Isabella Herrera PA
★ 4 · 26.06.2026

Speech recognition को LLM के साथ जोड़ने का तरीका बहुत साफ तरीके से समझाया गया है, बस image वाला हिस्सा थोड़ा और डिटेल में हो सकता था।

吉田 葵 JP Học viên đã xác minh
★ 5 · 02.06.2026

音声認識とLLMを組み合わせてマルチモーダルなアプリを作る流れが、初心者でも迷わないくらい丁寧に説明されています。

Cemile Karaca TR Học viên đã xác minh
★ 5 · 27.05.2026

Konuşmayı metne çevirip multimodal LLM'e bağladığım ilk uygulamayı kurmak şaşırtıcı derecede kolaydı, başlangıç için harika.

Peter Petersen DK Học viên đã xác minh
★ 5 · 25.05.2026

Clear intro to multimodal AI basics.

Viết đánh giá

Sau khi gửi, chúng tôi sẽ yêu cầu đăng nhập — bản nháp được lưu.

Học viên cũng học

Câu hỏi thường gặp

Tôi cần gì để học khóa này? +

Chỉ cần điện thoại hoặc máy tính có kết nối internet. Không cần cài đặt hay thiết bị đặc biệt.

Tôi thanh toán bằng cách nào? +

Bằng thẻ qua Stripe. Chúng tôi không lưu thông tin thẻ — Stripe xử lý an toàn.

Tôi có thể được hoàn tiền không? +

Có — hoàn tiền đầy đủ trong 14 ngày, không cần lý do.

Tôi sẽ có quyền truy cập trong bao lâu? +

Mãi mãi. Sau khi mua, khóa học là của bạn để xem lại bất cứ lúc nào.

Tôi có nhận được chứng chỉ không? +

Có. Sau khi hoàn thành, bạn sẽ nhận được chứng chỉ và có thể thêm vào hồ sơ LinkedIn.

Dành cho người học trong
Công nghệ Thiết kế Tài chính Marketing Y tế Giáo dục Khách sạn-Dịch vụ Sản xuất