A OpenAI anunciou o ChatGPT Images 2.0, novo sistema de geração de imagens que chega pouco mais de um ano após a integração inicial desse recurso ao chatbot. A empresa classifica a atualização como uma mudança de patamar, destacando avanços na execução de instruções detalhadas, na renderização de textos densos e no posicionamento de objetos dentro de cenas.
Raciocínio embutido e verificação
Pela primeira vez, a OpenAI afirma ter desenvolvido um modelo de imagem com capacidades de raciocínio, capaz de buscar informações na web e revisar suas próprias saídas. Segundo a empresa, esses recursos tornam a ferramenta mais confiável em situações que exigem precisão, consistência e coesão visual.
Avanços em idiomas não latinos
A empresa informou ter trabalhado para melhorar o entendimento e a representação de textos em sistemas de escrita não latinos, citando ganhos significativos em japonês, coreano, chinês, hindi e bengali. Além disso, o modelo manteve com mais fidelidade características específicas de diferentes linguagens visuais, o que, segundo a OpenAI, o torna mais útil em tarefas como prototipagem de jogos e criação de storyboards.
Flexibilidade, resolução e desempenho em testes
O Images 2.0 amplia a flexibilidade de proporções, suportando larguras de até 3:1 e alturas de até 1:3. O modelo gera imagens em resoluções de até 2K e pode produzir até oito variações simultaneamente. Em testes realizados pelo Electrek antes do lançamento público, o sistema foi desafiado a criar um “gato tartaruga” em estilo pixel art da terceira geração de Pokémon; o resultado foi considerado satisfatório ao capturar o estilo dos jogos de Game Boy Advance e, em seguida, convertido para PNG com fundo transparente.
Nos três testes citados, o sistema demorou mais na segunda tarefa e entregou uma saída ligeiramente diferente da primeira. Ainda assim, conseguiu gerar uma imagem transparente adequada — algo que, segundo o relato, costuma ser problemático para outros modelos de imagem.
Imagem: Divulgação
Limitações apontadas
A OpenAI reconhece que o ChatGPT Images 2.0 “está longe de ser infalível”. O modelo pode ter dificuldades em tarefas que exigem compreensão física consistente do mundo, como instruções complexas de origami, resolução de quebra-cabeças como o Cubo de Rubik e representação correta de elementos em superfícies ocultas, inclinadas ou invertidas. Padrões visuais muito densos ou repetitivos, como texturas de areia fina, também podem exigir atenção. Rótulos e diagramas que dependem de setas bem posicionadas ou identificação precisa de componentes podem demandar ajustes para garantir exatidão.
Disponibilidade e integração
O ChatGPT Images 2.0 já está disponível para todos os usuários do ChatGPT, incluindo os planos Free e Go. Assinantes dos planos Plus e Pro têm acesso a saídas mais avançadas. A OpenAI também disponibilizou o modelo por meio de sua API e integrou a geração de imagens ao aplicativo Codex, que foi atualizado na semana passada para incluir esse recurso. O lançamento acontece poucos dias após a entrada da Anthropic no mercado de design visual com seu próprio assistente de design.
Com informações de Olhardigital

Gudyê GR6 é editor-chefe e especialista em tendências musicais e entretenimento na GR6, a maior produtora de funk do Brasil. Com anos de experiência no mercado fonográfico, Gudyê lidera a equipe de conteúdo trazendo as últimas notícias sobre música, cultura urbana. Autor do Post: Gudyê GR6