toolsmith

Sem upload · tudo roda no seu navegador

A IA cria detalhe real ao ampliar uma imagem?

A resposta curta é não. A longa é mais útil: ela inventa detalhe que parece certo, e se isso ajuda depende inteiramente do que havia de errado com a sua imagem.

Atualizado

O que o modelo realmente faz

A ampliação comum tira a média dos pixels vizinhos. Não consegue inventar nada, então o resultado é uma versão maior e mais mole do que você tinha — nunca mais nítida.

Um modelo de ampliação faz outra coisa. Ele foi treinado com milhões de pares de imagens, cada um com uma grande e sua gêmea encolhida, até aprender como um cílio, uma parede de tijolos ou uma trama de tecido costumam ficar depois de reduzidos. Dada uma imagem pequena, ele escreve de volta uma grande plausível.

A palavra que trabalha ali é «plausível». O detalhe acrescentado não foi recuperado — a informação foi jogada fora quando a imagem foi reduzida, e sumiu. O que volta é um palpite confiante que se parece com o que provavelmente havia lá.

Medimos ele perdendo para o redimensionamento comum

Pegamos uma fotografia de domínio público de 1896, reduzimos para 240 pixels e ampliamos quatro vezes, com o modelo e com reamostragem comum de boa qualidade.

O modelo perdeu. Um tecido xadrez da imagem teve a trama apagada por completo — o modelo leu aquele padrão fino e regular como ruído e o alisou — e o rosto ficou parecendo cera. A ampliação comum ficou mais borrada e mais fiel.

E depois medimos ele ganhando com folga

Salvamos a mesma fotografia como JPEG de qualidade 35 — mais ou menos o estado de uma enorme quantidade de imagens que circulam pela internet — e refizemos a comparação. Desta vez o modelo ganhou de longe: os blocos da compressão sumiram e as bordas voltaram.

A razão é que esse tipo de modelo foi construído para reparar dano, não para ampliar. Ele remove o que lê como ruído. Blocagem de compressão é ruído, então some e a imagem melhora. Grão de filme e tecidos finos também são lidos como ruído, então também somem e a imagem piora.

Daí sai uma regra utilizável. Se o problema da sua imagem é que ela foi comprimida, capturada ou salva de novo até morrer, o modelo ajuda. Se o problema é só que ela é pequena mas está limpa, a ampliação comum pode ser o resultado mais honesto.

O teto de tamanho não é arbitrário

Quatro vezes a largura são dezesseis vezes os pixels. Um megapixel de entrada vira dezesseis de saída, e cada um deles é produzido por uma rede neural em vez de copiado.

Por isso existe um limite de entrada, e por isso desativamos o botão e explicamos o motivo em vez de deixar você tentar. Congelar a aba por vários minutos e não entregar nada é o pior resultado possível, e é o que acontece se o limite não for aplicado.

A opção 2× é feita produzindo o 4× e reduzindo pela metade, não pedindo 2× diretamente. O detalhe inventado se organiza ao encolher, então o resultado fica melhor. Leva o mesmo tempo, porque a parte cara aconteceu de qualquer jeito.

O modelo mais nítido não é o modelo certo

Comparamos dois candidatos com licença aceitável. O baseado em transformadores é visivelmente mais nítido e levou 9,7 segundos numa imagem de 128×128. O convolucional compacto levou 16,5 segundos numa de 512×512 — dezesseis vezes mais pixels. Por pixel, isso dá cerca de sessenta vezes de diferença.

E uma placa de vídeo não salva o lento. Aqui medimos a WebGPU cerca de 3,4 vezes mais rápida que a CPU, não as vinte ou cinquenta que as pessoas esperam, porque compilar sombreadores e mover dados até a placa custa tempo real. Três vezes vale a pena, mas um modelo inviável na CPU costuma continuar inviável na GPU.

Ou seja: o modelo mais nítido é aquele que ninguém esperaria, e o que vai no ar é o que termina. É o mesmo critério usado para escolher todo modelo deste site.

Faça agora, sem enviar nada

Ele consegue ler uma placa de carro, como na TV?

Não — e essa é a coisa mais importante a entender. Se os caracteres já se foram, o modelo vai produzir algo nítido, confiante e errado. Ele gera o que encaixa de forma plausível, exatamente a ferramenta errada para qualquer coisa que precise ser verdadeira.

Por que o resultado ficou com cara de cera ou de plástico?

Porque o seu original estava limpo. O modelo tira o que lê como ruído, e grão de filme, textura de pele e tecidos finos são todos lidos assim. Se a origem não tem dano de compressão a reparar, o redimensionamento comum costuma ser a escolha melhor.

Qual o tamanho máximo que posso ampliar?

Cerca de um megapixel na entrada, porque o 4× transforma isso em dezesseis megapixels na saída. Entradas maiores levariam minutos e poderiam esgotar a memória da aba, então a ferramenta recusa antes em vez de falhar no meio.

Vale a leitura