Ich habe einen Testlauf mit DeepSeek 4.1 flash max durchgeführt.
Das vollständige Protokoll findest du hier: https://gisthost.github.io/?28dedf78da999ccca5b5b4feb1d58fc9/index.html
Dieser Test war etwas kontaminiert, da ich ihn in einem dv-Container durchgeführt habe und der Agent zu einem bestimmten Zeitpunkt entschied, Docker effizienter für die Änderungen zu nutzen, anstatt auf unser MCP zu setzen.
Für die Bildgenerierung habe ich Qwen 3 Image verwendet.
Für die visuellen Checks habe ich dem Agenten das chrome-devtools-mcp zur Verfügung gestellt. Dies lässt sich leicht so konfigurieren, dass es Chromium unter Linux verwendet, was meine bevorzugte Option ist:
"chromium-devtools": {
"command": "npx",
"args": [
"-y",
"chrome-devtools-mcp@latest",
"--headless=true",
"--executable-path=/usr/bin/chromium",
"--chrome-arg=--no-sandbox",
"--chrome-arg=--disable-dev-shm-usage"
]
},
Der gesamte Lauf stützte sich auf DeepSeek 4.1 flash, sowohl für den Treiber- als auch für die Sub-Agenten.
Ich habe term-llm.com verwendet, um es im TUI-Modus zu steuern:
Ergebnisse:
Beobachtungen
Die Aufgabenstellung (Brief) ist entscheidend. Wenn du eine großartige Aufgabenstellung hast, werden die Ergebnisse großartig sein; wenn du eine schlechte hast, bist du dem LLM ausgeliefert. Eine großartige Aufgabenstellung beschreibt die Struktur und Farben, gibt Beispiele und so weiter.
DeepSeek 4.1 flash war in diesem Test sehr leistungsfähig und sehr günstig. Bei 99 % Cache-Reads und nur 2,8 Mio. gelesenen Tokens hätte dies außerhalb der Spitzenzeiten etwa 1,52 oder zu Spitzenzeiten **3,04 ** gekostet. Astra ist deutlich token-effizienter, daher ist dieser Vergleich unfair, aber zur Einordnung: Astra-Pricing für eine ähnliche Anzahl an Tokens würde 325 $ kosten.
Auch konservativ geschätzt und unter Berücksichtigung der Token-Effizienz würde ich schätzen, dass man ein Design wie dieses mit Astra für 50–100 Dollar umsetzen könnte. Es für 1,50 Dollar zu bekommen, ist bei den aktuellen API-Kosten unmöglich.
Ich habe dies mit meinem OpenCode go-Plan ausgeführt und habe nicht einmal ein kleines Loch in meinem 10-Dollar-monatlich-Plan festgestellt:
Ein paar Dinge haben mich bei diesem Lauf beeindruckt: Er konnte stundenlang unbeaufsichtigt laufen. Er handelte exakt nach der gleichen Aufgabenstellung in dem OP, gewissenhaft und sorgfältig. Er versuchte, jeden Punkt in der Aufgabenstellung zu adressieren, und testete alles akribisch.
Er hat vieles richtig gemacht und das Design ist solide.
Dennoch ist dies kein GPT 6 Astra; das Design wirkt für mich eher wie ein LLM-Design. Der Abstand, die Schriftarten und die Aufmerksamkeit für Details waren nicht auf Astra-Niveau. Es ist auch sehr deutlich, dass es nicht die gleiche visuelle Präzision hat wie Astra; nach Iteration 1 gab es viele offensichtliche visuelle Fehler, aber im positiven Sinne konnte es die meisten davon korrigieren, wenn man es dazu aufforderte.
Diesen einen Fehler verweigerte es aus irgendeinem Grund zu beheben:
Aber die restlichen Eigenheiten wurden von ihm problemlos behandelt.
Der beeindruckendste Teil des Builds war, wie ordentlich es darauf bestand zu sein:
- Es erstellte einen Ordner für Belege (Evidence)
- Es versuchte, das Theme sauber zu engineeringen, in viele Dateien aufzuteilen und sogar zu testen
Insgesamt: Erwarte kein Astra von einem Modell, das 50- bis 100-mal günstiger ist, aber als Werkzeug kann es durchaus sehr interessante Ergebnisse für einen Bruchteil der Kosten liefern.
Im Nachhinein würde ich empfehlen, das Theme direkt in einem dv-Container zu erstellen und dann hochzuladen, da man es sicher im YOLO-Modus ausführen kann und die Einrichtung sehr einfach ist.
Ich werde versuchen, nächste Woche weitere Experimente in dieser Richtung durchzuführen und ein paar weitere Beispiele zu posten. Wenn du eine spektakuläre Aufgabenstellung hast, lass es mich wissen.
Im Allgemeinen nutze ich mehrere LLMs von verschiedenen Anbietern, um Dinge zu bauen, daher könnte ein Beispiel vom Typ „So arbeite ich im Allgemeinen“ interessant sein.











