1 3
여백이 남으면 VAE latent 분포가 튀어 생성이 폭주합니다. 여백 있는 입력 6장 실측: 켜면 CER 0.119, 끄면 1.571(글자가 아예 무너짐). 이미 글자로 꽉 찬 이미지면 꺼도 무관.
📚 예시 스타일

📖 사용법

  1. 스타일 이미지 업로드 — 따라 할 손글씨/폰트 텍스트 한 줄 이미지 (크기는 알아서 맞춥니다)
  2. 스타일 전사(선택) — 스타일 이미지의 글자. 넣으면 정확도↑, 몰라도 동작 (예제 중 앞 3개는 실제 사람이 쓴 손글씨 스캔, 뒤 4개는 폰트 렌더입니다)
  3. 생성할 텍스트 입력CFG scale 조절생성

📊 현재 성능 (한글 HTR 리더 CER, n=100, cfg=1.0)

버킷 CER
한글 전체 0.127
한글 단문(1~3어절) 0.286 ← 가장 약한 구간
한글 중문(48) / 장문(915) 0.049 / 0.059
영어 전체 0.045

이 버전은 한글에 맞춰 VAE 까지 재학습(HERIUN/emuru_vae_korean, 한글 복원 오차 −83%)하고 그 latent 공간에 T5 를 재적응시킨 조합입니다. 이전 병목이던 단문 한글 CER 이 0.54 → 0.29 로 내려갔습니다.

: 스타일 이미지에 여백(종이 사진처럼)이 있으면 위 «여백 자동 제거» 를 반드시 켜세요. 여백 있는 입력 실측 CER 이 0.119(켬) vs 1.571(끔) 로, 끄면 글자 형태가 아예 무너집니다.

⚠️ 남은 한계: 짧은 문장이 여전히 가장 어렵고, 학습에 없던 극단적 디스플레이/붓글씨 폰트는 품질이 떨어집니다. VAE 가 잉크를 선명한 검정으로 스냅하므로 연필처럼 흐린 획은 보존되지 않습니다. 자세한 분석은 학습 repo 참고.

인용 (base model)

@inproceedings{zaccagnino2026eruku,
  title={Autoregressive Styled Text Image Generation, but Make it Reliable},
  author={Zaccagnino, Carmine and Quattrini, Fabio and Pippi, Vittorio and Cascianelli, Silvia and Tonioni, Alessio and Cucchiara, Rita},
  booktitle={WACV}, year={2026}
}