Construindo Aplicativos de IA Multimodais: Speech-to-Text e LLMs — WalkSelf
4.6 (12) ⏱ 2 h 42 min 📚 27 aulas

Construindo Aplicativos de IA Multimodais: Speech-to-Text e LLMs

Um guia amigável para iniciantes para desenvolvedores integrarem reconhecimento de voz, análise de imagem e LLMs multimodais em aplicações modernas usando APIs padrão e padrões de IA atuais.

  • 💬 Instrutor de IA
    Pergunte sobre qualquer aula e receba uma resposta clara na hora, quando quiser.
  • 🕐 Comece quando quiser
    Sem horários nem prazos: aprenda no seu ritmo, quando quiser.
  • 🌐 Em português
    Aulas, tarefas e certificado: tudo totalmente no seu idioma.

Sobre este curso

Aplicações modernas estão indo além do simples texto. Ao integrar capacidades de processamento de voz, imagem e vídeo, os desenvolvedores podem criar experiências de usuário altamente interativas e inteligentes. Este curso fornece uma compreensão fundamental de Large Language Models (LLMs) multimodais e tecnologias de speech-to-text. Você aprenderá a escrever código que interage com modelos de IA para transcrever áudio, analisar dados visuais e gerar respostas inteligentes, transformando aplicações padrão em ferramentas poderosas impulsionadas por IA. O que você aprenderá: - Compreender os conceitos centrais de IA multimodal e como os modelos processam diferentes tipos de dados; - Escrever código para integrar APIs de speech-to-text para transcrição de áudio precisa; - Processar e analisar imagens e frames de vídeo usando capacidades modernas de LLM; - Aplicar técnicas fundamentais de prompt engineering adaptadas para entradas multimodais; - Implementar padrões básicos de Retrieval-Augmented Generation (RAG) para mídia rica; - Construir scripts baseados em texto que orquestram fluxos de trabalho de IA complexos de forma integrada. O currículo começa com terminologia essencial de IA e conceitos fundamentais antes de passar para a integração prática de API e manipulação de dados. Você progredirá através de lições escritas estruturadas e trechos de código que aumentam sua confiança no tratamento programático de vários tipos de mídia. Este curso foi projetado para desenvolvedores iniciantes e engenheiros fullstack que buscam entrar no espaço da IA, sem necessidade de experiência prévia em machine learning. Comece a ler hoje para desbloquear o potencial da IA multimodal em seu próximo projeto de desenvolvimento.

O que você vai receber

  • 📜 Certificado de conclusão
    Adicione ao seu perfil do LinkedIn
  • 💬 Tutor AI pessoal
    Travou em uma aula? Pergunte ao seu tutor integrado qualquer coisa, a qualquer hora.
  • ♾️ Acesso vitalício
    Volte quando quiser, sem expirar
  • 📱 Celular ou computador
    Funciona em qualquer dispositivo
  • 💸 Reembolso em 14 dias
    Sem perguntas
  • Curto e focado
    2 h 42 min de conteúdo prático

Avaliações (12)

مريم بنت أحمد بن راشد آل ثاني QA Aluno verificado
★ 4 · 24 julho 2026

شرح جيد لكن سريع بعض الشيء.

Henry Walker AU
★ 4 · 24 julho 2026

Nice walkthrough of hooking speech-to-text into an LLM pipeline, though the image portion feels a bit rushed compared to the audio section.

Esi Adu GH Aluno verificado
★ 5 · 15 julho 2026

Really practical intro to combining speech-to-text with an LLM, and the pacing between audio and image sections feels well balanced.

Renata Flores UY
★ 5 · 14 julho 2026

Me sorprendió lo accesible que resulta combinar reconocimiento de voz con un modelo de lenguaje después de este curso. Va construyendo la app multimodal pieza por pieza, primero el audio, luego cómo pasarlo al LLM, y se entiende perfectamente incluso sin experiencia previa en IA.

Fernanda Mendes BR
★ 5 · 7 julho 2026

O curso mostra bem como conectar reconhecimento de fala a um LLM para montar um app multimodal do zero. Gostei especialmente da parte prática, onde você grava um áudio e vê o modelo respondendo em tempo real.

Pablo Ruiz ES Aluno verificado
★ 4 · 2 julho 2026

Bien explicado, aunque algo denso al final.

Hava Akın TR
★ 4 · 29 junho 2026

Ses tanıma kısmı gerçekten iyi anlatılmış.

Lina Marlina ID
★ 5 · 28 junho 2026

Panduan integrasi speech-to-text dan LLM-nya sangat mudah diikuti untuk pemula, langsung praktik bikin fitur multimodal dari awal.

Isabella Herrera PA
★ 4 · 26 junho 2026

Speech recognition को LLM के साथ जोड़ने का तरीका बहुत साफ तरीके से समझाया गया है, बस image वाला हिस्सा थोड़ा और डिटेल में हो सकता था।

吉田 葵 JP Aluno verificado
★ 5 · 2 junho 2026

音声認識とLLMを組み合わせてマルチモーダルなアプリを作る流れが、初心者でも迷わないくらい丁寧に説明されています。

Cemile Karaca TR Aluno verificado
★ 5 · 27 maio 2026

Konuşmayı metne çevirip multimodal LLM'e bağladığım ilk uygulamayı kurmak şaşırtıcı derecede kolaydı, başlangıç için harika.

Peter Petersen DK Aluno verificado
★ 5 · 25 maio 2026

Clear intro to multimodal AI basics.

Escrever uma avaliação

Pediremos para fazer login após enviar — o rascunho fica salvo.

Outros também fizeram

Perguntas frequentes

O que preciso para fazer este curso? +

Só um celular ou computador com internet. Sem instalações nem hardware especial.

Como faço para pagar? +

Com cartão via Stripe. Não guardamos dados do cartão — o Stripe processa com segurança.

Posso pedir reembolso? +

Sim — reembolso integral em 14 dias, sem perguntas.

Por quanto tempo terei acesso? +

Para sempre. Uma vez comprado, o curso é seu para revisar quando quiser.

Vou receber um certificado? +

Sim. Ao concluir, você recebe um certificado que pode adicionar ao seu perfil do LinkedIn.

Feito para profissionais em
Tecnologia Design Finanças Marketing Saúde Educação Hotelaria Indústria