참고팁Reddit
최신 이미지 모델의 'POV(1인칭 시점)' 생성 및 로컬 대안 탐색
특정 인물의 시점(POV) 생성은 비용이 높음. 오픈소스 모델로 이를 구현하려는 실험적 시도와 한계를 공유합니다.
요약
최근 이미지 생성 AI 분야에서 특정 인물의 시점(POV)에서 장면을 생성하는 기능이 주목받고 있으며, Meta의 Muse Image나 Nano Banana 모델이 이를 성공적으로 구현하고 있다. 그러나 해당 모델들은 대규모 운영에 비용 부담이 크다는 제약이 있어, 오픈소스 솔루션에 대한 논의가 활발히 진행 중이다. 기존 오픈소스 모델인 Qwen Image Edit, FLUX.2 9B Base, Hunyuan Image 3.0 Instruct를 활용한 테스트에서는 특정 인물의 시점을 정확히 반영하는 데 한계가 드러났다. 사용자는 대안으로 Gemma 4 모델을 활용해 해당 인물이 보는 장면을 묘사하는 캡션 생성을 시도하고 있다. 현재 오픈소스 진영에서는 이와 같은 시점 기반 이미지 생성을 효율적으로 구현할 수 있는 대안 기술을 찾기 위한 기술적 검증이 이어지고 있다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 POV Generation
원문 보기 ↗