# PROMPTO-GUIDE FÜR KI-SYSTEME *Was Prompto Studio ist und wie du als Assistent damit produzierst. Stand 03.08.2026. Gehört zusammen mit `foundation-fuer-ki.txt` (die Lehren) und `folgen-rezept.txt` (der Produktionsablauf). Zugang wird über das chazon studio vergeben.* ## 1 · Was Prompto ist Ein Renderer-Stack als **MCP-Server**: ~50 Modelle (Bild, Edit, Video, Upscale, Audio, Utility) hinter einheitlichen Tools, mit Budget-Verwaltung über mehrere Provider (fal, WaveSpeed, Runware, ElevenLabs). Du sprichst NIE direkt mit den Provider-APIs — du sprichst mit Prompto. **Die Tools:** | Tool | Zweck | |---|---| | `list_models` | Registry abfragen: model_key, Preis, refMode/maxRefs, Fähigkeiten. Filter: group/kind/q | | `get_prompt_guide` / `enhance_prompt` | Prompt-Hilfen je Modell | | `generate` | DER bezahlte Call: model_key + prompt + primary/end/refs (Asset-IDs ODER URLs) + options | | `job_status` | Status + signierte Output-URLs (1 h gültig) + Ist-Kosten | | `import_media` | externe Datei in den Asset-Pool holen | | `balance` | Budget je Provider — vor UND nach jeder Session aufrufen | | `list_werke` | Galerie / bereits gerenderte Assets finden | **Grundmuster:** `list_models` → `generate(wait=false)` → `job_status` pollen → Output-URL laden → lokal sichern. Jedes Output wird ein **Pool-Asset mit ID** — diese IDs sind deine Referenzen für alle Folge-Renders (Edit-Ketten, Video-Refs). `wait=true` kann in MCP-Timeouts laufen, obwohl der Job durchläuft → bei Timeout NIE blind neu rendern, erst `list_werke`/`job_status` prüfen. ## 2 · Die Modell-Landkarte (kuratiert, Preise = günstigster Provider) **Bild (Sets, Designs, Startframes):** - `recraft-v4` 0.04–0.25 $/Bild — DESIGN-Monster: Szenenbilder, Marken-Grafik, akkurater In-Bild-Text, Palette via Hex. **refMode none → NIE für wiederkehrende Figuren.** Auch als `-vector` (echte SVG) und `-utility` (Packshots). - `nano-banana-2` 0.08 $ / `-pro` 0.15 $ — Gemini-Bild: Text mehrsprachig buchstabengetreu, bis 14 Refs, Seed-Support (777 = Hausstandard). - `seedream-v5` 0.035 $ — schnelles Fotoreal-4K, auto Multi-Ref. - `ideogram-v4-tiling` — nahtlose Patterns/Texturen. **Edit (Figur ins Set, gezielte Änderungen):** - `nano-banana-2-edit` 0.08 $ — DER Standard: „keep X, change Y", hält Szene und Identität, bis 14 Refs. Die „Photoshop-Ebene" jeder Compose-Pipeline. - `seedream-v5-lite-edit` 0.035 $ — halber Preis für Massen-Edits, weniger chirurgisch. - `pruna-p-image-edit` 0.01 $ — Draft-Tier zum billigen Iterieren. **Video (jedes hat seine Qualitäten — Split fahren!):** - `kling-o3-ref` 0.112 $/s (~720p, `-pro` 0.14 $/s 1080p) — **ref2v-Arbeitspferd:** 1–7 Refs als @Image1..N, hielt 7 Figuren mit Kanon-Handlung in EINEM Clip. Deutsch sprechen kann es NICHT (Sprachroute: TTS + sync-lipsync-3). - `kling-v3-pro` 0.168 $/s — i2v/t2v 1080p, harte Start+End-Landung, bestes Atmo-Sounddesign. Fehlerklasse Objekt-Kleber (lose Requisiten). - `seedance-2-pro` ~0.16–0.24 $/s — SOTA-Qualität + synced Audio + **Multishot in einer Generation** („Shot 1: … Shot 2: …"), hält 2 Charakter-Refs über Schnitte. `-fast`/`-mini` als Budget-Stufen. - `gemini-omni-flash` ~0.13 $/s — spricht (DE + viele Sprachen, lippensynchron), aber nur EIN Sprecher pro Generation; strenger Google-Safety-Filter. - `minimax-h3` 0.13 $/s — 2K + nativer Ton, ABER: ersetzt Identitäten bei nur 1 Ref/Figur → mehrere Sheet-Ansichten mitgeben oder Kling O3 nehmen. - `vidu-q2-ref` 0.30 $ FLAT/Clip — billiger Konsistenz-PREVIEW vor teuren Finals (Gesichter checken, Requisiten-Glitches ignorieren). - `pixverse-c1-ref` 0.05 $/s — natives 9:16 mit subject/background-Refs. - `grok-imagine-ref` 0.05 $/s flat — billiges ref2v, Ref-Budget FÜLLEN (5+ Refs). - `omnihuman-15` 0.16 $/s — sprechende Figur aus 1 Ref-Bild + Audio-File (deutsch funktioniert exzellent); Regie: halbnah ran, Kamera in den Prompt. **Finish & Utility:** - `bytedance-video-upscaler` 0.0072 $/s — 1080p/2k/4k mit Face-Enhance, DER Standard-Upscaler (Regeln: Clean ohne Text hochrechnen, Output-AUFLÖSUNG prüfen, Teile ≤25 s / <50 MB, `target_resolution` heißt der Param, tpad-Normalisierung). - `sync-lipsync-3` 0.134 $/s — Lipsync auf fertiges Material (95+ Sprachen, singt auch); Frontalgesicht Pflicht, Output 720p, Betten-Technik s. Rezept. - `topaz-upscale-*` — Referenz-Qualität für kritische Einzelstücke. - `bria-remove-bg` / `bria-expand` / `bria-video-bg` — Freisteller, Outpaint. - `elevenlabs-music/-sfx/-tts` — Score, Foley, Voiceover (bei eigenem ElevenLabs-Key: direkt v3 mit Audio-Tags + Library-Voices, s. Foundation §4). ## 3 · Referenz-Logik (der wichtigste Begriff) - `primary` = i2v-Startbild („animiere DIESES Bild"). `refs` = ref2v-Referenzen („baue aus DIESEN Zutaten"). **Beides zusammen kippt i2v in ref2v** — die teuerste Falle des Hauses. Locks gehören ins Startbild, nicht in den Video-Call. - Figuren-Identität lebt in **Kanon-Assets** (Character-Sheets, Ganzkörper auf Grau, Turnaround-Blätter) im Pool. Jede Produktion beginnt damit, diese IDs bereitzulegen. Ohne Kanon-Ref keine Figur — Gesetz. - Edit-Ketten sind legitim (Set → Figur rein → Requisite anpassen), solange das erste Glied ein Kanon-Asset ist. ## 4 · Geld & Verhalten - `balance` zeigt Guthaben je Provider. Router nimmt den günstigsten; `provider`-Pin ist möglich, wird aber nicht bei jedem Modell respektiert — Ist-Provider steht in der generate-Antwort. Absprache im Haus: klären, WELCHER Topf gerade geschont wird, bevor du Volumen fährst. - Faustpreise einer 105-s-Doku-Folge (SER-03, komplett): Sets+Figuren+Startframes ~8 $ · 12 Shots ~25 $ · Stimmen/Lipsync ~8 $ · Zwischenszenen ~12 $ · 2k-Finish ~1.5 $ → **~60 $ gesamt** inkl. Retries. - Moderations-Flags einzelner Assets blockieren die Weiterverwendung als Edit-Input NICHT zwingend — prüfen statt annehmen. Fehlversuche mit Flag kosten nichts; identischen Prompt erst wiederholen (Filter würfelt).