Rodei um teste com o DeepSeek 4.1 flash max.
O transcript completo está aqui: https://gisthost.github.io/?28dedf78da999ccca5b5b4feb1d58fc9/index.html
Isso ficou um pouco contaminado, porque executei o teste em um contêiner dv e, em certo momento, o agente decidiu que seria mais eficiente usar o Docker para fazer as alterações em vez de depender do nosso MCP.
Para a geração de imagens, usei o Qwen 3 Image.
Para a visão, dei ao agente o chrome-devtools-mcp. Isso pode ser facilmente configurado para usar o Chromium no Linux, que tende a ser minha escolha:
"chromium-devtools": {
"command": "npx",
"args": [
"-y",
"chrome-devtools-mcp@latest",
"--headless=true",
"--executable-path=/usr/bin/chromium",
"--chrome-arg=--no-sandbox",
"--chrome-arg=--disable-dev-shm-usage"
]
},
Toda a execução dependeu do DeepSeek 4.1 flash tanto para o agente principal quanto para os subagentes.
Usei o term-llm.com para operá-lo em modo TUI:
Resultados:
Observações
O briefing é crítico. Se você tiver um ótimo briefing, os resultados serão ótimos; se tiver um briefing ruim, estará à mercê do LLM. Um ótimo briefing fala sobre a estrutura, as cores, dá exemplos, e assim por diante.
O DeepSeek 4.1 flash foi muito capaz neste teste e muito barato. Com 99% de leitura de cache e apenas 2,8M de tokens lidos, isso teria custado cerca de US$ 1,52 fora do horário de pico ou US$ 3,04 no preço de pico. O Astra é significativamente mais eficiente em tokens, então isso não é justo, mas, para contextualizar, o preço do Astra para um número semelhante de tokens seria US$ 325.
De forma conservadora, mesmo levando em conta a eficiência de tokens, eu apostaria que você poderia conseguir um design como este no Astra por 50 a 100 dólares. Conseguí-lo por 1 dólar e 50 é impossível com os custos atuais da API.
Executei isso no meu plano OpenCode go e nem senti uma pequena dentada no meu plano de US$ 10 por mês:
Algumas coisas me impressionaram nesta execução: ela foi capaz de rodar desatendida por horas. Ela agiu com base no EXATO mesmo briefing de o post original diligentemente e com cuidado. Tentou abordar cada ponto do briefing e testou meticulosamente tudo.
Acertou muita coisa e o design é sólido.
Dito isso, isso não é o GPT 6 Astra; o design me parece mais um design de LLM. O espaçamento, as fontes e a atenção aos detalhes não eram os mesmos do Astra. Também está muito claro que ele não tem a mesma fidelidade em visão que o Astra; houve muitos glitches visuais óbvios após a iteração 1. No lado positivo, ele foi capaz de corrigir a maioria deles quando solicitado.
Ele se recusou a corrigir este por algum motivo:
Mas o restante das peculiaridades foi tratado sem problemas.
A parte mais impressionante da construção foi o quão organizado ele insistiu em ser:
- Ele criou uma pasta para evidências
- Ele tentou projetar o tema de forma limpa, dividi-lo em muitos arquivos e até testá-lo
No geral, não espere o nível do Astra de um modelo 50/100 vezes mais barato, mas, como ferramenta, ele certamente pode produzir resultados muito interessantes por uma fração do custo.
Em retrospecto, recomendaria construir o tema diretamente em um contêiner dv e depois fazer o upload, pois você pode executá-lo com segurança em modo YOLO e a configuração é muito fácil.
Vou tentar fazer mais alguns experimentos sobre isso na próxima semana e postar mais alguns exemplos.











