logo Faceless Video Maker
Tutorial

Wie man mit KI auffällige B-Roll-Bilder für YouTube-Videos erstellt

Stockmaterial ist teuer und generisch. Derselbe Clip erscheint in Tausenden von Videos. KI-generierte Bilder ermöglichen es Ihnen, individuelle visuelle Inhalte zu erstellen, die genau dem entsprechen, was Ihr Skript sagt – und sie sind einzigartig für Ihr Video.

· 8 Minuten Lesezeit

Was ist B-Roll und warum ist es wichtig?

B-Roll ist das visuelle Material, das auf dem Bildschirm läuft, während der Sprecher spricht. In einer traditionellen Videoproduktion ist es das Filmmaterial, das die Geschichte unterstützt – ein Schnitt zu einer Straße, einem alten Foto, einer Nahaufnahme eines Objekts.

In einem gesichtslosen YouTube-Video sind B-Roll-Bilder Ihre gesamte visuelle Ebene. Der Zuschauer sieht eine Bildfolge, während er den Voiceover hört. Die Qualität, Vielfalt und Relevanz dieser Bilder wirken sich direkt darauf aus, ob die Zuschauer weitersehen.

Warum nicht einfach Stockfotos verwenden? Stockfotos sind generisch, wirken veraltet und passen oft nicht zum spezifischen Moment in Ihrem Skript. KI-generierte Bilder können genau das zeigen, was Ihre Erzählung beschreibt – eine bestimmte Szene, eine bestimmte Ära, eine bestimmte Stimmung.

Schritt für Schritt: B-Roll-Bilder für Ihr Video erstellen

1

Die Einstellungsliste hat die Bilder bereits festgelegt

Es gibt keinen separaten Schritt, bei dem Sie das Skript in bildgroße Stücke schneiden. Als der Planer Ihre Geschichte schrieb, schrieb er sie als Einstellungsliste: jede Einstellung ist ein Bild plus die genaue Zeile, die darüber gesprochen wird. Wenn Sie also zur Einstellungsliste gelangen, ist jedes benötigte Bild bereits beschrieben.

Jede Zeile enthält eine englische visuelle Aufforderung, die für das Bildmodell geschrieben wurde. Die Erzählung kann in einer der neun unterstützten Sprachen sein – die Aufforderung bleibt Englisch, weil das die Sprache ist, mit der das Bildmodell trainiert wurde, und es sichtbar schlechter wird, wenn es anders ist.

2

Generieren Sie die Bilder

Klicken Sie auf "Bilder generieren" und die Warteschlange arbeitet die Einstellungen der Reihe nach ab, eine Anfrage pro Einstellung, jeweils 5 Credits. Sie sehen jedes Bild in seiner Zeile erscheinen, anstatt auf einen einzelnen Spinner zu starren – und wenn eine Einstellung fehlschlägt, kostet das nur diese Einstellung und nicht den gesamten Lauf.

Eine Einstellung, die bereits ein Bild hat, wird ohne Berechnung übersprungen, sodass ein erneutes Ausführen der Warteschlange nach einem Fehler nur für das bezahlt, was tatsächlich fehlt.

Screenshot of a project page: Publishing Details with title, description, hashtags and hook text, above a Shot List of 11 shots — each row showing the generated image, the spoken narration line, the English image prompt, the take duration and an inline audio player

Jede Einstellung zeigt ihr Bild, die darüber gesprochene Zeile und den Prompt, der es erstellt hat.

3

Ein Seed hält die Besetzung konsistent

Beim Speichern der Einstellungsliste wird einmalig ein einzelner Seed festgelegt, den jede Einstellung im Projekt verwendet – auch jede einzelne Einstellung, die du später neu zeichnest. Dadurch bleibt dieselbe Figur von Einstellung zu Einstellung wiedererkennbar, anstatt dass plötzlich mitten in der Geschichte eine fremde Person auftaucht.

Zusammen mit dem von dir ausgewählten Stil, der für jede Einstellung beibehalten wird, sorgt das dafür, dass die Sequenz wie ein einziges Video wirkt und nicht wie ein Ordner voller zusammenhangloser Bilder.

4

Überprüfen und neu zeichnen

Scrolle durch die Einstellungsliste und suche nach allem, was nicht passt. Bei jeder einzelnen Einstellung kannst du:

  • Neu zeichnen – regeneriert nur diese Einstellung mit demselben Prompt und dem Projekt-Seed (5 Credits)
  • Prompt bearbeiten – die visuelle Beschreibung umschreiben, dann mit etwas Spezifischerem neu zeichnen
  • Bild löschen – entfernt es und seine gespeicherte Datei, kostenlos; die Einstellung bleibt und kann später neu gezeichnet werden

Das Löschen ist immer kostenlos. Du zahlst nur, wenn tatsächlich ein Bild generiert wird, und eine fehlgeschlagene Generierung wird automatisch erstattet.

Den richtigen Bildstil für Ihre Nische wählen

Ihr Bildstil definiert die visuelle Identität Ihres Kanals. Wählen Sie einen, der zu Ihrem Inhalt passt – und bleiben Sie konsistent. Hier sind die Hauptoptionen:

Cinematic

Geschichte, True Crime, Dokumentation

Kinodokumentarische Fotografie. Funktioniert für jede Nische, die von einem bodenständigen, glaubwürdigen Look profitiert.

Anime

Horror, Fantasy, Action

Anime-Illustration mit Cel-Shading und ausdrucksstarken Charakteren. Großartig für geschichtenbasierte Inhalte, bei denen Emotionen im Mittelpunkt stehen.

Watercolour

Reisen, Kultur, Human Interest

Lockeres Aquarell mit weichen, verlaufenden Rändern. Funktioniert für Inhalte, die Wärme und Textur benötigen.

Storybook

Kindergeschichten, Gute-Nacht-Geschichten, Fabeln

Warme Bilderbuchillustration mit weichen, runden Formen. Die natürliche Wahl für sanfte erzählerische Inhalte.

Minimal

Finanzen, Wissenschaft, Bildung

Flache Illustration mit großzügigem Negativraum. Ideal für erklärende Inhalte, die Klarheit über Atmosphäre stellen.

Vintage Film

Geschichte, Kultur der 70er–90er Jahre

Körniger 35-mm-Film mit verblassten, gedeckten Farben. Perfekt für historische Inhalte oder nostalgische Kanäle.

Sie können auch eine benutzerdefinierte Stilbeschreibung eingeben, anstatt eine Voreinstellung zu wählen – zum Beispiel „dunkles Ölgemälde mit dramatischen Schatten“ oder „Kinderbuchillustration“.

Wie Bilder im exportierten Video zeitlich abgestimmt werden

Du musst nicht festlegen, wie lange jedes Bild auf dem Bildschirm bleibt. Jede Einstellung bleibt genau so lange sichtbar wie ihre eigene Sprecheraufnahme und schneidet dann direkt zur nächsten – das Bild wechselt, sobald die Stimme weiterspricht.

Dies ist keine gleichmäßig aufgeteilte Gesamtdauer. Eine Einstellung, deren Zeile 12 Sekunden zum Lesen benötigt, hält 12 Sekunden; die nächste, bei 7 Sekunden, hält 7. Da die Zeiten aus den echten Takes stammen, stimmen die Untertitel genau überein, anstatt von der Stimme abzudriften.

Während eine Einstellung auf dem Bildschirm ist, zoomt sie langsam hinein und schwenkt (der Ken-Burns-Effekt), sodass ein Standbild dennoch als Bewegung wahrgenommen wird.

Die Übergänge zwischen den Bildern sind Überblendungen – das letzte Bild eines Bildes geht in das erste Bild des nächsten über. Dies verleiht dem Video ein sanftes, professionelles Gefühl ohne manuelle Bearbeitung.

Generieren Sie Ihre ersten B-Roll-Bilder kostenlos

50 kostenlose Credits bei der Anmeldung. Beginnen Sie noch heute mit der Erstellung benutzerdefinierter Visuals für Ihr nächstes YouTube-Video.

Kostenlos starten