Erstellung multimodaler AI-Apps: Speech-to-Text und LLMs — WalkSelf
4.6 (12) ⏱ 2 Std. 42 Min. 📚 27 Lektionen

Erstellung multimodaler AI-Apps: Speech-to-Text und LLMs

Ein einsteigerfreundlicher Leitfaden für Entwickler zur Integration von Spracherkennung, Bildanalyse und multimodalen LLMs in moderne Anwendungen unter Verwendung von Standard-APIs und aktuellen AI-Mustern.

  • 💬 KI-Tutor
    Stelle Fragen zu jeder Lektion und erhalte jederzeit sofort eine klare Antwort.
  • 🕐 Jederzeit starten
    Keine Zeitpläne oder Fristen – lerne in deinem Tempo, wann es dir passt.
  • 🌐 Auf Deutsch
    Lektionen, Aufgaben und Zertifikat – alles vollständig in deiner Sprache.

Über diesen Kurs

Moderne Anwendungen entwickeln sich über einfachen Text hinaus. Durch die Integration von Sprach-, Bild- und Videoverarbeitungsfunktionen können Entwickler hochgradig interaktive und intelligente Benutzererlebnisse schaffen. Dieser Kurs vermittelt ein grundlegendes Verständnis von multimodalen Large Language Models (LLMs) und Speech-to-Text-Technologien. Sie lernen, wie Sie Code schreiben, der mit AI-Modellen interagiert, um Audio zu transkribieren, visuelle Daten zu analysieren und intelligente Antworten zu generieren, wodurch Standardanwendungen in leistungsstarke AI-gesteuerte Tools verwandelt werden. Was Sie lernen werden: Verstehen der Kernkonzepte von multimodaler AI und wie Modelle verschiedene Datentypen verarbeiten; Schreiben von Code zur Integration von Speech-to-Text-APIs für präzise Audiotranskription; Verarbeiten und Analysieren von Bildern und Videoframes mit modernen LLM-Funktionen; Anwenden grundlegender Prompt Engineering-Techniken, die auf multimodale Eingaben zugeschnitten sind; Implementieren grundlegender Retrieval-Augmented Generation (RAG)-Muster für Rich Media; Erstellen textbasierter Skripte, die komplexe AI-Workflows nahtlos orchestrieren. Das Curriculum beginnt mit essenzieller AI-Terminologie und grundlegenden Konzepten, bevor es zur praktischen API-Integration und Datenverarbeitung übergeht. Sie werden durch strukturierte schriftliche Lektionen und Code-Snippets geführt, die Ihr Vertrauen im programmatischen Umgang mit verschiedenen Medientypen stärken. Dieser Kurs richtet sich an Anfänger-Entwickler und Fullstack-Ingenieure, die in den AI-Bereich einsteigen möchten, wobei keine vorherige Machine Learning-Erfahrung erforderlich ist. Beginnen Sie noch heute mit dem Lesen, um das Potenzial multimodaler AI in Ihrem nächsten Entwicklungsprojekt freizusetzen.

Was du erhältst

  • 📜 Abschlusszertifikat
    Füge es deinem LinkedIn-Profil hinzu
  • 💬 Persönlicher AI-Tutor
    Bei einer Lektion nicht weitergekommen? Frag deinen integrierten Tutor jederzeit alles, was du möchtest.
  • ♾️ Lebenslanger Zugang
    Komme jederzeit zurück, kein Ablauf
  • 📱 Smartphone oder Computer
    Auf jedem Gerät, überall
  • 💸 14 Tage Rückgaberecht
    Ohne Wenn und Aber
  • Kurz und fokussiert
    2 Std. 42 Min. praktische Inhalte

Bewertungen (12)

مريم بنت أحمد بن راشد آل ثاني QA Verifizierter Lernender
★ 4 · 24 Juli 2026

شرح جيد لكن سريع بعض الشيء.

Henry Walker AU
★ 4 · 24 Juli 2026

Nice walkthrough of hooking speech-to-text into an LLM pipeline, though the image portion feels a bit rushed compared to the audio section.

Esi Adu GH Verifizierter Lernender
★ 5 · 15 Juli 2026

Really practical intro to combining speech-to-text with an LLM, and the pacing between audio and image sections feels well balanced.

Renata Flores UY
★ 5 · 14 Juli 2026

Me sorprendió lo accesible que resulta combinar reconocimiento de voz con un modelo de lenguaje después de este curso. Va construyendo la app multimodal pieza por pieza, primero el audio, luego cómo pasarlo al LLM, y se entiende perfectamente incluso sin experiencia previa en IA.

Fernanda Mendes BR
★ 5 · 7 Juli 2026

O curso mostra bem como conectar reconhecimento de fala a um LLM para montar um app multimodal do zero. Gostei especialmente da parte prática, onde você grava um áudio e vê o modelo respondendo em tempo real.

Pablo Ruiz ES Verifizierter Lernender
★ 4 · 2 Juli 2026

Bien explicado, aunque algo denso al final.

Hava Akın TR
★ 4 · 29 Juni 2026

Ses tanıma kısmı gerçekten iyi anlatılmış.

Lina Marlina ID
★ 5 · 28 Juni 2026

Panduan integrasi speech-to-text dan LLM-nya sangat mudah diikuti untuk pemula, langsung praktik bikin fitur multimodal dari awal.

Isabella Herrera PA
★ 4 · 26 Juni 2026

Speech recognition को LLM के साथ जोड़ने का तरीका बहुत साफ तरीके से समझाया गया है, बस image वाला हिस्सा थोड़ा और डिटेल में हो सकता था।

吉田 葵 JP Verifizierter Lernender
★ 5 · 2 Juni 2026

音声認識とLLMを組み合わせてマルチモーダルなアプリを作る流れが、初心者でも迷わないくらい丁寧に説明されています。

Cemile Karaca TR Verifizierter Lernender
★ 5 · 27 Mai 2026

Konuşmayı metne çevirip multimodal LLM'e bağladığım ilk uygulamayı kurmak şaşırtıcı derecede kolaydı, başlangıç için harika.

Peter Petersen DK Verifizierter Lernender
★ 5 · 25 Mai 2026

Clear intro to multimodal AI basics.

Bewertung schreiben

Du wirst nach dem Senden zur Anmeldung aufgefordert — dein Entwurf bleibt gespeichert.

Andere belegten auch

Häufige Fragen

Was brauche ich, um diesen Kurs zu belegen? +

Nur Telefon oder Computer mit Internet. Keine Installation, keine spezielle Hardware.

Wie kann ich bezahlen? +

Per Karte über Stripe. Wir speichern keine Kartendaten — Stripe übernimmt das sicher.

Kann ich eine Rückerstattung erhalten? +

Ja — volle Rückerstattung innerhalb von 14 Tagen, ohne Wenn und Aber.

Wie lange habe ich Zugang? +

Für immer. Nach dem Kauf kannst du jederzeit zum Kurs zurückkehren.

Erhalte ich ein Zertifikat? +

Ja. Nach Abschluss erhältst du ein Zertifikat, das du in dein LinkedIn-Profil aufnehmen kannst.

Entwickelt für Lernende in
Tech Design Finanzen Marketing Gesundheit Bildung Gastgewerbe Produktion