¿La IA añade detalle real al ampliar una imagen?
La respuesta corta es que no. La larga es más útil: se inventa detalle que parece correcto, y que eso ayude depende por completo de qué le pasaba a tu imagen.
Actualizado
Lo que hace el modelo en realidad
Una ampliación normal promedia los píxeles vecinos. No puede inventar nada, así que el resultado es una versión más grande y más blanda de lo que tenías, nunca más nítida.
Un modelo de ampliación hace otra cosa. Lo entrenaron con millones de pares de imágenes — una grande y su gemela encogida — hasta que aprendió qué aspecto suele tener una pestaña, un muro de ladrillo o un tejido cuando se reduce. Dada una imagen pequeña, escribe una grande verosímil.
La palabra que trabaja ahí es «verosímil». El detalle que añade no está recuperado: la información se tiró cuando la imagen se hizo pequeña y ya no está. Lo que vuelve es una conjetura segura de sí misma que se parece a lo que probablemente había.
Lo medimos perdiendo contra un redimensionado normal
Cogimos una fotografía de dominio público de 1896, la redujimos a 240 píxeles y la ampliamos cuatro veces con el modelo y con un remuestreo normal de buena calidad.
El modelo perdió. A un tejido de cuadros de la imagen se le borró la trama por completo — el modelo leyó ese patrón fino y regular como ruido y lo alisó — y la cara quedó como de cera. La ampliación normal era más borrosa y más fiel.
Y después lo medimos ganando con claridad
Guardamos la misma fotografía como JPEG de calidad 35 — más o menos el estado de muchísimas imágenes que circulan por internet — y repetimos la comparación. Esta vez el modelo ganó de largo: los bloques de compresión desaparecieron y los bordes volvieron.
El motivo es que esta clase de modelo está hecha para reparar daño, no para agrandar. Elimina lo que lee como ruido. El bloqueo por compresión es ruido, así que se va y la imagen mejora. El grano de película y los tejidos finos también se leen como ruido, así que también se van y la imagen empeora.
De ahí sale una regla utilizable. Si el problema de tu imagen es que la han comprimido, capturado o vuelto a guardar hasta matarla, el modelo ayuda. Si el problema es solo que es pequeña pero por lo demás está limpia, la ampliación normal puede ser el resultado más honesto.
El muro del tamaño no es arbitrario
Cuatro veces el ancho son dieciséis veces los píxeles. Un megapíxel de entrada sale convertido en dieciséis, y cada uno de ellos lo produce una red neuronal en vez de copiarse.
Por eso hay un límite de entrada y por eso desactivamos el botón y explicamos el motivo en lugar de dejarte probar. Congelar la pestaña varios minutos para no dar nada es el peor resultado posible, y es lo que pasa si no se pone el límite.
El ×2 se hace produciendo el ×4 y reduciéndolo a la mitad, no pidiendo ×2 directamente. El detalle inventado se ordena al encogerse, así que el resultado es mejor. Tarda lo mismo, porque la parte cara ya ha ocurrido igualmente.
El modelo más nítido no es el modelo correcto
Comparamos dos candidatos con licencia aceptable. El basado en transformadores es visiblemente más nítido y tardó 9,7 segundos con una imagen de 128×128. El convolucional compacto tardó 16,5 segundos con una de 512×512, dieciséis veces más píxeles. Por píxel, la diferencia es de unas sesenta veces.
Y una tarjeta gráfica no rescata al lento. Aquí medimos WebGPU unas 3,4 veces más rápido que la CPU, no las veinte o cincuenta que espera la gente, porque compilar sombreadores y mover datos a la tarjeta cuesta tiempo real. Tres veces se agradece, pero un modelo inservible en CPU suele seguir siendo inservible en GPU.
Así que el modelo más nítido es el que nadie esperaría, y el que va montado es el que termina. Es el mismo criterio con el que se ha elegido cada modelo de este sitio.
Hazlo ahora, sin subir nada
¿Puede leer una matrícula, como en la tele?
No, y es lo más importante que hay que entender. Si los caracteres ya no están, el modelo producirá algo nítido, seguro y falso. Genera lo que encaja de forma verosímil, que es justo lo contrario de lo que necesitas cuando algo tiene que ser cierto.
¿Por qué queda con aspecto de cera o de plástico?
Porque tu original estaba limpio. El modelo quita lo que lee como ruido, y el grano de película, la textura de la piel y los tejidos finos se leen así. Si el origen no tiene daño de compresión que reparar, un redimensionado normal suele ser mejor opción.
¿Qué tamaño de imagen puedo ampliar?
Alrededor de un megapíxel de entrada, porque el ×4 lo convierte en dieciséis de salida. Con entradas mayores tardaría minutos y podría agotar la memoria de la pestaña, así que la herramienta lo rechaza antes en vez de fallar a mitad.
Vale la pena leer
- Qué es un archivo HEIC y por qué no abre
- PNG, JPG, WebP o AVIF: ¿cuál deberías usar?
- Por qué tu PDF pesa tanto y qué lo reduce de verdad
- MOV frente a MP4: qué cambia de verdad
- Cómo funciona quitar el fondo de verdad — y cuándo falla
- SRT o VTT — ¿qué archivo de subtítulos necesitas?
- Qué son los stems — ¿y de verdad se puede desmezclar una canción?
- ¿Por qué no se abre mi PDF?
- CSV frente a Excel — qué cambia de verdad
- ¿Se puede fiar uno de un resumen hecho por IA?
- WAV o MP3: ¿cuál necesitas realmente?
- ¿Qué es un códec y en qué se diferencia de MP4?
- ¿Por qué mi vídeo sale de lado?