Image Preprocessing and Building Image Captioning AI Models — WalkSelf
⏱ 2 h 54 min 📚 29 aulas 🎧 Versão em áudio

Image Preprocessing and Building Image Captioning AI Models

Learn to clean and prepare visual data, tokenize text, and build deep learning models that automatically generate descriptive captions for images.

  • 💬 Instrutor de IA
    Pergunte sobre qualquer aula e receba uma resposta clara na hora, quando quiser.
  • 🕐 Comece quando quiser
    Sem horários nem prazos: aprenda no seu ritmo, quando quiser.
  • 🌐 Em português
    Aulas, tarefas e certificado: tudo totalmente no seu idioma.

Sobre este curso

Raw images and text descriptions cannot be fed directly into deep learning models without careful preparation. Understanding how to align visual data with natural language is the key to building successful image captioning systems. In this written course, you will progress from understanding foundational computer vision concepts to designing and training your own image captioning pipeline. You will learn to clean, resize, and normalize images, prepare text metadata, and leverage modern deep learning architectures to bridge the gap between sight and language. What you'll learn: - Understand foundational computer vision concepts and image representations in Python. - Apply essential preprocessing techniques including resizing, normalization, and data augmentation. - Tokenize and preprocess text captions using modern natural language processing workflows. - Build dataset pipelines to efficiently feed paired image and text data into neural networks. - Configure deep learning architectures, such as CNN-LSTM and modern Vision Transformer (ViT) hybrids, for image-to-text tasks. - Evaluate model performance using standard natural language generation metrics. The course begins with core terminology and basic image manipulations before guiding you through data pipeline construction, model architecture design, and training processes through clear written explanations and code examples. This course is designed for beginners interested in computer vision and natural language processing, with no advanced mathematical background required. Start reading today to master the foundations of multimodal AI development.

O que você vai receber

  • 📜 Certificado de conclusão
    Adicione ao seu perfil do LinkedIn
  • 💬 Tutor AI pessoal
    Travou em uma aula? Pergunte ao seu tutor integrado qualquer coisa, a qualquer hora.
  • 🎧 Versão em áudio incluída
    Estude em qualquer lugar, sem tela
  • ♾️ Acesso vitalício
    Volte quando quiser, sem expirar
  • 📱 Celular ou computador
    Funciona em qualquer dispositivo
  • 💸 Reembolso em 14 dias
    Sem perguntas
  • Curto e focado
    2 h 54 min de conteúdo prático

Avaliações

Ainda não há avaliações — seja o primeiro a compartilhar sua experiência.

Escrever uma avaliação

Pediremos para fazer login após enviar — o rascunho fica salvo.

Outros também fizeram

Perguntas frequentes

O que preciso para fazer este curso? +

Só um celular ou computador com internet. Sem instalações nem hardware especial.

Como faço para pagar? +

Com cartão via Stripe. Não guardamos dados do cartão — o Stripe processa com segurança.

Posso pedir reembolso? +

Sim — reembolso integral em 14 dias, sem perguntas.

Por quanto tempo terei acesso? +

Para sempre. Uma vez comprado, o curso é seu para revisar quando quiser.

Vou receber um certificado? +

Sim. Ao concluir, você recebe um certificado que pode adicionar ao seu perfil do LinkedIn.

Feito para profissionais em
Tecnologia Design Finanças Marketing Saúde Educação Hotelaria Indústria