toolsmith

업로드 없음 · 전부 브라우저에서 처리

AI 업스케일은 없던 세부를 되살릴까

짧은 답은 '아니오' 입니다. 긴 답이 더 쓸모 있습니다 — 그럴듯해 보이는 세부를 지어내는 것이고, 그것이 도움이 되는지는 원래 그 그림에 무엇이 잘못돼 있었는지에 달려 있습니다.

수정

모델이 실제로 하는 일

평범한 확대는 옆 화소들을 평균 냅니다. 없던 것을 만들 수 없으니 결과는 더 크고 더 흐릿한 같은 그림입니다. 절대 더 선명해지지 않습니다.

업스케일 모델은 다른 일을 합니다. 큰 그림과 그것을 줄인 짝을 수백만 쌍 보면서, 줄어든 속눈썹·벽돌·옷감 결이 어떻게 생겼는지를 익힙니다. 그러고는 작은 그림을 받아 그럴듯한 큰 그림을 써 냅니다.

여기서 일하는 낱말은 '그럴듯한' 입니다. 더해진 세부는 되찾은 것이 아닙니다 — 그림을 작게 만들 때 버려진 정보는 사라졌고 돌아오지 않습니다. 돌아오는 것은 그 자리에 아마 있었을 법한 것을 닮은, 자신 있는 추측입니다.

평범한 확대에 지는 것을 실측했습니다

1896년 퍼블릭 도메인 사진을 240픽셀로 줄인 다음, 모델과 일반 고품질 리샘플링으로 각각 4배 키워 비교했습니다.

모델이 졌습니다. 사진 속 격자무늬 옷감의 결이 통째로 지워졌고 — 모델이 그 곱고 규칙적인 무늬를 잡음으로 읽고 매끈하게 밀어 버렸습니다 — 얼굴은 밀랍처럼 나왔습니다. 평범한 확대 쪽이 더 흐릿하지만 원본에 더 충실했습니다.

그리고 확실히 이기는 것도 실측했습니다

같은 사진을 품질 35의 JPEG로 한 번 저장한 뒤 — 인터넷을 돌아다니는 이미지의 상당수가 대략 이 상태입니다 — 같은 비교를 다시 했습니다. 이번에는 모델이 큰 차이로 이겼습니다. 네모나게 뭉개진 압축 자국이 사라지고 윤곽이 돌아왔습니다.

이 계열의 모델이 확대가 아니라 손상 복구를 위해 만들어졌기 때문입니다. 잡음이라고 읽은 것을 지웁니다. 압축으로 생긴 블로킹은 잡음이니 사라지고 그림이 좋아집니다. 필름 그레인과 고운 옷감 결도 잡음으로 읽히니 함께 사라지고 그림이 나빠집니다.

여기서 쓸 만한 기준이 나옵니다. 내 그림의 문제가 압축·화면 캡처·재저장으로 뭉개진 것이라면 모델이 도움이 됩니다. 문제가 그저 작다는 것뿐이고 원본이 깨끗하다면, 평범한 확대가 더 정직한 결과일 수 있습니다.

크기 제한은 아무렇게나 정한 것이 아닙니다

너비를 4배로 키우면 화소는 16배가 됩니다. 100만 화소를 넣으면 1600만 화소가 나오고, 그 화소 하나하나가 복사된 것이 아니라 신경망이 만들어 낸 것입니다.

그래서 입력 크기에 상한이 있고, 넘으면 그냥 해 보게 두는 대신 버튼을 잠그고 이유를 적습니다. 탭을 몇 분 얼려 놓고 결국 아무것도 못 내놓는 것이 가장 나쁜 결과이고, 상한이 없으면 실제로 그렇게 됩니다.

2배는 2배를 직접 만드는 대신 4배로 만든 뒤 절반으로 줄여 만듭니다. 지어낸 세부가 줄어들면서 정돈되기 때문에 결과가 더 낫습니다. 시간은 같습니다 — 비싼 계산은 어느 쪽이든 이미 끝난 뒤입니다.

가장 선명한 모델이 맞는 모델은 아닙니다

라이선스가 쓸 만한 후보 둘을 비교했습니다. 트랜스포머 쪽이 눈에 띄게 선명한데, 128×128 그림에 9.7초가 걸렸습니다. 얕은 합성곱 쪽은 512×512 그림에 16.5초였습니다 — 화소가 16배입니다. 화소당으로 환산하면 대략 60배 차이입니다.

그래픽카드가 느린 쪽을 구제해 주지도 않습니다. 여기서 WebGPU는 CPU보다 약 3.4배 빨랐습니다. 사람들이 기대하는 20배나 50배가 아닙니다 — 셰이더를 컴파일하고 자료를 카드로 옮기는 데 실제로 시간이 들기 때문입니다. 3배는 의미가 있지만, CPU에서 못 쓸 모델은 GPU에서도 대개 못 씁니다.

그래서 더 선명한 쪽은 아무도 기다려 주지 않을 모델이고, 실제로 실린 것은 끝까지 도는 모델입니다. 이 사이트의 모든 모델을 같은 기준으로 골랐습니다.

업로드 없이 지금 해 보기

드라마처럼 번호판을 읽을 수 있나요?

없습니다. 그리고 이것이 이 도구에서 가장 중요하게 알아 둘 점입니다. 글자가 이미 사라졌다면 모델은 선명하고 자신 있고 틀린 것을 만들어 냅니다. 그럴듯하게 들어맞는 것을 지어내는 물건이라, 사실이어야 하는 일에는 정확히 맞지 않는 도구입니다.

결과가 밀랍처럼 매끈해졌어요.

원본이 깨끗했기 때문입니다. 모델은 잡음으로 읽은 것을 지우는데 필름 그레인·피부 결·고운 옷감이 전부 그렇게 읽힙니다. 복구할 압축 손상이 없는 원본이라면 평범한 확대가 나은 선택인 경우가 많습니다.

얼마나 큰 그림까지 키울 수 있나요?

들어가는 쪽이 100만 화소쯤까지입니다. 4배면 그것이 1600만 화소로 나오기 때문입니다. 더 크면 몇 분이 걸리고 탭의 메모리가 바닥날 수 있어, 도중에 실패하는 대신 미리 거부합니다.

읽어 둘 만한 글