Aprendizagem automática com PySpark: Ciência de dados distribuídos em escala — WalkSelf
⏱ 3 h 📚 30 aulas

Aprendizagem automática com PySpark: Ciência de dados distribuídos em escala

Aprenda a criar, avaliar e implantar modelos de machine learning em conjuntos de dados massivos usando o PySpark e fluxos de trabalho de computação distribuída.

  • 💬 Instrutor de IA
    Pergunte sobre qualquer aula e receba uma resposta clara na hora, quando quiser.
  • 🕐 Comece quando quiser
    Sem horários nem prazos: aprenda no seu ritmo, quando quiser.
  • 🌐 Em português
    Aulas, tarefas e certificado: tudo totalmente no seu idioma.

Sobre este curso

À medida que os conjuntos de dados crescem demais para uma única máquina, as ferramentas tradicionais de ciência de dados atingem seus limites. Dominar o machine learning distribuído permite treinar modelos em conjuntos de dados massivos de forma eficiente. Este curso baseado em texto orienta você desde os conceitos fundamentais de big data até a criação e a implantação de pipelines de machine learning escaláveis. Você aprenderá a processar dados em grande escala e executar algoritmos de aprendizado de máquina em clusters usando o PySpark. O que você vai aprender: - Entenda os conceitos básicos de computação distribuída, arquitetura Spark e PySpark DataFrames. - Prepare e limpe conjuntos de dados em grande escala usando as ferramentas de engenharia de recursos do PySpark. - Construa e treine modelos de aprendizado de máquina supervisionados para classificação e regressão. - Implementar técnicas de aprendizagem não supervisionadas, incluindo algoritmos de agrupamento e recomendação. - Construa pipelines de aprendizado de máquina de ponta a ponta para automatizar a preparação de dados e o treinamento de modelos. - Integre fluxos de trabalho MLflow modernos para rastrear experimentos e gerenciar versões de modelos dentro do pipeline do Spark. Você começará com a terminologia-chave, conceitos básicos de arquiteturas distribuídas e definições fundamentais antes de passar para os passos práticos do código. O material progride logicamente da ingestão e limpeza de dados para a avaliação de modelos e gerenciamento de ciclo de vida. Projetado para cientistas de dados iniciantes, analistas e desenvolvedores que desejam fazer a transição para big data, este curso não requer experiência prévia com sistemas distribuídos. Comece a ler hoje para desbloquear o poder do aprendizado de máquina distribuído com o PySpark.

O que você vai receber

  • 📜 Certificado de conclusão
    Adicione ao seu perfil do LinkedIn
  • 💬 Tutor AI pessoal
    Travou em uma aula? Pergunte ao seu tutor integrado qualquer coisa, a qualquer hora.
  • ♾️ Acesso vitalício
    Volte quando quiser, sem expirar
  • 📱 Celular ou computador
    Funciona em qualquer dispositivo
  • 💸 Reembolso em 14 dias
    Sem perguntas
  • Curto e focado
    3 h de conteúdo prático

Avaliações

Ainda não há avaliações — seja o primeiro a compartilhar sua experiência.

Escrever uma avaliação

Pediremos para fazer login após enviar — o rascunho fica salvo.

Outros também fizeram

Perguntas frequentes

O que preciso para fazer este curso? +

Só um celular ou computador com internet. Sem instalações nem hardware especial.

Como faço para pagar? +

Com cartão via Stripe. Não guardamos dados do cartão — o Stripe processa com segurança.

Posso pedir reembolso? +

Sim — reembolso integral em 14 dias, sem perguntas.

Por quanto tempo terei acesso? +

Para sempre. Uma vez comprado, o curso é seu para revisar quando quiser.

Vou receber um certificado? +

Sim. Ao concluir, você recebe um certificado que pode adicionar ao seu perfil do LinkedIn.

Feito para profissionais em
Tecnologia Design Finanças Marketing Saúde Educação Hotelaria Indústria