Bild- und Medien-Prompting

Bild-Prompting

Frühe Sprachmodelle waren auf Text beschränkt. Moderne KI-Systeme (zum Beispiel Chatbots) basieren auf multimodalen Modellen, die neben Text auch Bilder, Audio und Video verarbeiten können.

Für die Arbeit mit Bildern gibt es einerseits spezialisierte Anwendungen (zum Beispiel Midjouney), andererseits haben die großen Chatbot-Anbieter spezialisierte Modelle in ihre Chatbots integriert (Google Gemini, Microsoft Copilot, ChatGPT, …).

Diese können als Werkzeuge eingesetzt werden zur:

Folgende Prompt-Elemente haben sich für Bild-Prompting bewährt:

Kategorie Beispiele
Hauptmotiv Löwe, Architekturmodell, Person am Schreibtisch
Details / Handlung mit blonden Haaren, beim Lesen, im Regen stehend
Umgebung Großstadt bei Nacht, Wald, Studiohintergrund
Stil / Medium fotorealistisch, Aquarell, 3D-Render, Vektorgrafik
Licht / Atmosphäre weiches Licht, Neonlicht, ruhig, dramatisch
Kamera / Perspektive Nahaufnahme, Weitwinkel, Vogelperspektive, 35-mm-Look

Beispiele

Ein kleines Fischerboot treibt auf einem ruhigen, nebligen See, weiche und stille Atmosphäre, Aquarellstil, Totale

Ein Mechaniker mit ölverschmierten Händen arbeitet an einer Maschine in einer Werkstatt voller Werkzeuge, gedämpftes industrielles Licht, realistisches Gemälde, Nahaufnahme

Ein Radrennfahrer im Sprint auf einer kurvigen Landstraße, Zuschauer am Straßenrand, entschlossener Gesichtsausdruck, helles Tageslicht, energiegeladene Stimmung, fotorealistisch, seitliche Verfolgungsperspektive

Ein Mountainbiker springt über eine Wurzel auf einem unebenen Waldtrail, Staub wird aufgewirbelt, Licht fällt gefiltert durch die Bäume, dynamische Stimmung, High-Speed-Fotografie, tiefe Perspektive mit Weitwinkel

Manchmal lassen sich bessere Ergebnisse erzielen, wenn man mit Begriffen aus der professionellen Fotografie vertraut ist und diese gezielt anwendet (zur genauen Bedeutung und weiteren Begriffen befrage am besten das Internet oder den Chatbot):
Nahaufnahme, Vogelperspektive, Froschperspektive, Weitwinkel, Teleobjektiv, Makro, Fischauge, Tiefenschärfe, cinematischer/filmischer Look, Kurzzeit- Langzeitbelichtung, Bewegungsunschärfe, eingefrorene Bewegung (gestochen scharf, Action), Mitzieher (Motiv scharf, Hintergrund verwischt), Verfolgungsperspektive, …

Auch Malstile und Maltechniken können beim Bildprompting angefordert werden:
Aquarell, Ölmalerei, Acryl, Pastell, Kohlezeichnung, Bleistiftzeichnung, Tuschezeichnung, Radierung, Holzschnitt, Linolschnitt, Impressionismus, Expressionismus, Surrealismus, Realismus, Abstraktion, Minimalismus, Pop Art, Kubismus, Pointillismus, digitale Illustration, Konzeptkunst, Skizzenstil, Comicstil, Manga-Stil, Graffiti, Collage, …
Nennt man bestimmte Maler (zum Beispiel Picasso), kann es sein, dass der Chatbot das aus urheberrechtlichen Bedenken verweigert. In dem Fall kann man sich aber helfen, indem man typische Merkmale des Malers nennt (kubistische Formen, reduzierte Farbpalette, …). Ist der Maler seit mehr als 70 Jahren tot (zum Beispiel Leonardo) dann ist das Urheberrecht ausgelaufen und eine Umsetzung kann direkt erfolgen.

Bilderstellung

Lass auf diese Art ein Bild nach deinen Wünschen erzeugen.

Genau wie beim Text-Prompting kannst du auch hier, wenn du mit dem Ergebnis nicht zufrieden bist, Änderungen im Dialogverfahren oder durch einen überarbeiteten Prompt anfordern. Auch hier wiederum hilft es oft einen neuen Chat zu starten, wenn der Chatbot weitere Anforderungen missachtet.

Bilderstellung: Stilvorgabe

Stilvorgabe

Bei der Bilderstellung kannst du ein Bild hochladen und es als Stilvorgabe verwenden:

Das Hochladen wird mit Drücken auf eine eine Taste mit 📎︎-Symbol oder dem Text “Datei hochladen” eingeleitet oder dem Ziehen der Bilddateien in das Fenster (Drag & Drop).

Bilder, auf die der Chatbot bereits trainiert ist, weil sich ihre Abbildung in öffentlichen Bildsammlungen befindet, müsste man gar nicht hochladen.
Das gilt natürlich auch für die Mona Lisa, eines der bekanntesten Bilder der Welt.
Der Vorgang hier dient der Veranschaulichung und legt auch eindeutig fest mit welcher Version der Abbildung gearbeitet werden soll, die sich im Detail in Qualität und Farbwiedergabe stark unterscheiden können.

Mach ein Bild der Skyline von Manhattan im Stil des hochgeladenen Bilds.

Ergebnis

Du kannst auch ein Bild mithilfe einer Stilvorgabe verändern lassen:

Ändere die Landschaft im Stil der hochgeladenen Mona Lisa.

Ergebnis

Bilderstellung: Eine Grafik ändern

Ändern durch einen Prompt

Auch durch geeignete Prompts lassen sich Grafiken verändern:

Zeige die Mona Lisa mit Brillen, Ohrringen und Schmuck.

Zeige die Mona Lisa in Sportkleidung, wie sie in einem modernen Fitnessstudio ein Selfie im Spiegel macht.


Mach aus der Mona Lisa ein modernes Portraitfoto im Stil eines Polaroid (= Sofortbild). Im Hintergrund eine fröhliche Party.

Mit einem geeigneten Prompt, lass die Mona Lisa oder ein Bild deiner Wahl vom Chatbot verändern.

Ideen:
Mona Lisa in einer Eiswüste, eingehüllt in einen dicken Pelzmantel, mit Nordlichtern am Himmel.
Mona Lisa, sitzend vor der Skyline von Tokio bei Nacht, mit leuchtenden Werbetafeln und Regen, der gegen eine Fensterscheibe peitscht.
Mona Lisa in einer Unterwasserwelt, umgeben von Korallenriffen, tropischen Fischen und schimmerndem Licht, das durch die Wasseroberfläche bricht.

Beispiele für weitere Möglichkeiten

Bild erweitern

Auf diese Art vergrößern wir ein Bild, indem wir auf einer gewünschten Seite passende Inhalte hinzufügen lassen:

Erweitere das Gemälde links und rechts im Stil der Mona Lisa von Leonardo da Vinci. Ergänze eine realistische Renaissance-Landschaft mit Wegen, Wasser, Felsen und atmosphärischer Tiefe. Nahtlose Übergänge ohne sichtbare Kanten, exakt gleiche Farbpalette, Beleuchtung, Textur und Malstil des Originals. Das zentrale Motiv unverändert lassen.

Lass dieses Bild vom Chatbot links und rechts erweitern.

Im Prompt könnten zum Beispiel Vorgaben erfolgen, ob die neu erstellten Bereiche noch urbaner order noch natürlicher ausfallen sollen.

Erweiterte Inhalte kann man im Prompt genau beschreiben oder man kann es dem Zufall überlassen, was vom Chatbot generiert wird.

Auflösung vergrößern

Ein herkömmliches Bildverarbeitungsprogramm kann Bilder vergrößern. Das geht aber auf Kosten der Bildqualität. Der Chatbot kann Bilder ohne großen Qualitätsverlust vergrößern. Das funktioniert gut, wenn die Bildinhalte eindeutig zu erkennen sind. Ansonsten kann es vorkommen, dass sie vom Chatbot falsch gedeutet und dadurch verfälscht werden.

Vergrößere das Bild um den Faktor drei. Mach aus den 250x140 ein Bild mit 750x420.

Das Vergrößern hat sehr gut funktioniert. Vor allem wenn man bedenkt, dass die Vorlage durch die geringe Auflösung sehr schlechte Qualität hat.

Lass die Mona Lisa oder ein Bild deiner Wahl vom Chatbot vergrößern.
Was sind die Grenzen dieser Vorgangsweise?

Bilder kombinieren

Statt der Mona Lisa soll der Robo-Barde auf dem Portrait sein, aber im Stil des Originals.

Lass selbst aus zwei Bildern deiner Wahl eine Kombination erstellen.
Lass zum Beispiel Elemente des einen Bilds in das andere versetzen.

Logos

Bisher haben wir überwiegend mit Bitmap-Bilddateien gearbeitet.
Für bestimmte Zwecke benötigt man jedoch Grafiken, die sich beliebig vergrößern und in hoher Qualität drucken lassen. Logos gehören beispielsweise zu dieser Kategorie. Für solche Bilder kommen Vektorformate zum Einsatz. SVG ist ein weit verbreitetes Vektorformat für Grafiken.

Die Abbildung oben zeigt den Unteschied zwischen Bitmap (Bildmitte) und Vektor-Grafiken (rechts). Vektorgrafiken behalten in jeder Vergrößerung scharfe Ränder.

LLMs können SVG-Dateien oft gut analysieren und als Eingabe verarbeiten. Das Erstellen oder gezielte Überarbeiten komplexer SVG-Grafiken gelingt ihnen jedoch noch nicht zuverlässig.

SVGs sind für aktuelle LLMs schwierig, da diese eine Kombination aus Code, Geometrie und grafischem Design darstellen. An der Unterstützung von SVGs wird intensiv daran gearbeitet und zukünftige Systeme, werden mit hoher Wahrscheinlichkeit über diese Unterstützung verfügen.

Eine vorläufige Lösung besteht deshalb oft darin, nicht direkt SVG-Dateien generieren zu lassen, sondern zunächst Bitmap-Bilder zu erzeugen, die bestimmte wichtige Eigenschaften erfüllen. Diese Bilder werden anschließend möglichst automatisch vektorisiert.

Folgender Beispiel-Prompt zeigt die Erzeugung eines solchen Bilds:

Erstelle ein minimalistisches, modernes Logo für eine neu gegründete private Weltraumorganisation im klaren SVG- bzw. Vektorstil.
Das Bild soll:
einfache geometrische Formen verwenden,
klare und scharfe Konturen besitzen,
aus wenigen Farben bestehen, und sich gut automatisch vektorisieren lassen.

optional hier ein noch ausführlicherer Prompt:

Erstelle ein minimalistisches, modernes Logo für eine neu gegründete private Weltraumorganisation im klaren SVG- bzw. Vektorstil.
Das Logo soll:

einfache geometrische Formen verwenden,
klare und scharfe Konturen besitzen,
aus wenigen Farben bestehen,
hohe Kontraste haben,
keine fotorealistischen Effekte enthalten,
keine komplexen Texturen oder Schatten verwenden,
als flache Vektorgrafik wirken,
leicht vektorisierbar sein,
professionell, technisch und futuristisch aussehen.

Mögliche Elemente:
stilisierte Rakete, Umlaufbahn, Planet, Stern, abstrakte Satellitenform, kreisförmiges Emblem.

Designstil:
modern, clean, symmetrisch,
inspiriert von Raumfahrtlogos und technischen Emblemen.

Farben:
hauptsächlich Dunkelblau, Weiß und Silber/Grau,
maximal 3–4 Farben.

Wichtig:
große zusammenhängende Farbflächen,
keine feinen Details,
keine Verläufe,
keine 3D-Effekte,
keine Schrift oder nur sehr einfache serifenlose Typografie.
Das Ergebnis soll wie eine saubere SVG-Vektorgrafik wirken und sich gut automatisch vektorisieren lassen.

Ergebnis

Dabei handelt es sich noch um eine .png-Datei also im Bitmap-Format. Mithilfe geeigneter Werkzeuge (zum Beispiel die freie Software Inkscape) kann dieses Bild teilweise automatisch in Vektorformat umgewandelt werden:

Ergebnis

Dieses Bild kann beliebig vergrößert werden und behält dennoch seine Schärfe.

Lass selbst ein Bild im Stil einer solchen Vektorgrafik erstellen.

Du kannst dafür Teile aus obigen Prompt übernehmen.
Du kannst auch, wie schon beim Text-Prompting vorgezeigt, einen geeigneten Prompt vom Chatbot vorschlagen lassen.

Schlag mir einen Prompt vor, mit dem ich ein Logo im SVG Stil erzeugen kann.

Das von dir gewünschte Thema kannst du entweder schon oben in diese Aufforderung oder beim fertigen Prompt hinzufügen.

Bilder untersuchen

Texterkennung / OCR (Optical Character Recognition)

Der Chatbot kann Text auf Bildern sehr gut erkennen und in bearbeitbaren elektronischen Text umwandeln. Wenn einzelne Zeichen oder Wörter schlecht zu erkennen sind, versucht der Chatbot mithilfe der benachbarten Wörter und Sätze die fehlende Information abzuleiten oder erraten.
Auch Handschriften, Diagramme und Tabellen können erkannt und umgewandelt werden.

Mach ein Foto eines Textes und lass ihn vom Chatbot “transkribieren” (= in elektronischen Text umwandeln).

Bilder untersuchen: Aus einem Bild einen Prompt erzeugen

Aus einem Bild kann man auch einen Prompt erzeugen:

Mit welchem Prompt hätte ich dieses Bild bekommen?

Diesen Prompt kann ich dann verwenden um ein im Stil ähnliches Bild zu erzeugen und insbesondere kann ich den Prompt gezielt anpassen, um das Ergebnis zu verändern.

Beispiel

Mit welchem Prompt hätte ich dieses Bild bekommen?

Ruhiger See bei Sonnenuntergang in der blauen Stunde, spiegelglatte Wasseroberfläche mit perfekter Reflexion des Himmels, dunkle Baum-Silhouetten am Ufer, orangefarbener Horizont, klarer Abendhimmel mit sanftem Farbverlauf von Orange zu Dunkelblau, stille und friedliche Atmosphäre, natürliche Fotografie, Weitwinkelaufnahme, realistisch, hohe Bildqualität.

Ich verwende dann einen angepassten Prompt:

Ruhiger See bei Sonnenuntergang in der blauen Stunde, vom Wind leicht bewegte Wasseroberfläche mit Reflexion des Himmels, dunkle Baum-Silhouetten am Ufer, orangefarbener Horizont, vereinzelte Wolken am Abendhimmel mit sanftem Farbverlauf von Orange zu Dunkelblau, stille und friedliche Atmosphäre, natürliche Fotografie, Weitwinkelaufnahme, realistisch, hohe Bildqualität. In der Ferne der Schein eines Lagerfeuers.

Ergebnis

Das funktioniert oft besser als hätte ich das Originalbild mit einem Prompt verändert und es erlaubt eine gezieltere Kontrolle.

Lass für ein Bild deiner Wahl einen Prompt erzeugen, verändere den Prompt und erzeuge damit ein verändertes Bild.

Audio

Sprache

Speech-to-Text

Moderne Chatbots (ChatGPT, Google Gemini, Microsoft Copilot, …) integrieren Spracherkennung, wodurch gesprochene Sprache automatisch in Text umgewandelt und weiterverarbeitet werden kann.
Dadurch können Chatbots auf gesprochene Fragen reagieren und Antworten ebenfalls in gesprochener Form ausgeben und man kann sie zur Transkription einsetzen indem sie gesprochene Sprache automatisch in geschriebenen Text umwandeln.
Zum Starten der Spracherkennung drückt man meist das 🎤-Symbol.

Diktiere auf diese Weise einen kurze Text und speichere das Ergebnis in einer Textdatei.

Text-to-Speech

Bei Text-to-Speech (TTS) wird geschriebener Text automatisch in gesprochene Sprache umgewandelt. Moderne KI-Systeme erzeugen dabei sehr natürliche Stimmen mit passender Betonung, Geschwindigkeit und Ausdruck.
Das wird vor allem für Sprachassistenten, Navigationssystemen, Hörbüchern und Lernanwendungen eingesetzt.
Das funktioniert in Chatbots momentan nur teilweise, aber bei einigen Webseiten (zum Beispiel naturalreaders.com) kann man die Funktionalität ausprobieren.

Lass dir einen kurzen Text von einm KI-System vorlesen.

naturalreaders.com

Musik

Mit KI-Musik-Anwendungen kann man online (zum Beispiel auf suno.com) oder in installierten Anwendungen mithilfe geeigneter Prompts sowie durch die Auswahl von Eigenschaften wie Genre, Instrumenten und Stimmung Liedtexte, dazugehörige Musik oder vollständige Lieder generieren.
Auch professionelle Musiksoftware für Komposition oder Notensatz kann mit Plugins nachgerüstet werden, um mithilfe von KI einzelne Sequenzen oder Spuren zu erzeugen und weiterzubearbeiten.

Video

Text-to-Video

Mit KI-Video-Anwendungen (zum Beispiel Runway, Sora, …) lassen sich aus Texteingaben kurze Videosequenzen oder vollständige Clips generieren. Dabei können Inhalte, Stil, Kameraführung, Perspektive, Beleuchtung, Animationen oder Stimmungen durch geeignete Prompts beschrieben und beeinflusst werden. Manche Chatbots (zum Beispiel Google Gemini) bieten inzwischen die Möglichkeit, direkt über ihre normale Benutzeroberfläche KI-Videos zu generieren

Image-to-Video

Bei diesem Verfahren (zum Einsatz kommen wieder Runway, Sora, Google Gemini, …) dienen einzelne Bilder oder Grafiken als Ausgangspunkt, aus denen mithilfe von KI animierte Szenen oder Bewegungsabläufe erzeugt werden. Dadurch können beispielsweise Kamerafahrten, Gesichtsbewegungen, Übergänge oder kurze Animationen automatisch erstellt und anschließend weiterbearbeitet werden.

Beispiel

Erstelle eine kurze Animation dieser Szene. Ein Schmetterling soll vorbeifliegen und die Katze schaut ihm nach.

Beispiele für weitere Techniken für Video

Pose-to-Video

Die Bewegungen und Körperhaltungen einer Person werden auf digitale Figuren übertragen.

Lip Sync

Mundbewegungen werden automatisch an Sprache oder Audio angepasst.

Storyboard-to-Video

Mehrere Frames, Skizzen oder Szenenbeschreibungen werden automatisch zu einem zusammenhängenden Video verbunden.