Speech Processing, Multimodal Learning, Conversational AI
연구실 소개
MINT Lab 은 인간과 인공지능 사이의 자연스러운 소통을 위한 차세대 멀티모달 기술을 연구합니다. 인간의 대화가 시각과 청각을 비롯한 오감의 상호작용에 기반한다는 사실에 주목하여, Speech Synthesis 및 Talking Face Generation과 같은 핵심 AI 기술을 연구합니다. 이를 통해 메타버스 환경에서 가상 개체와 인간이 현실감 있게 상호작용할 수 있는 혁신적인 소통 패러다임을 제시하며, 디지털 환경의 몰입감을 극대화하는 것을 목표로 합니다.
학력사항
2026 한국과학기술원 전기및전자공학부 박사
2022 고려대학교 인공지능학과 석사
2019 경희대학교 수학과 학사 (부전공: 컴퓨터공학)
주요경력
2026.03 - 현재: 조교수, 중앙대학교 첨단영상대학원
2025.05 - 2025.11: Visiting Scholar, Carnegie Mellon University
1) CrossSpeech++: Cross-lingual Speech Synthesis with Decoupled Language and Speaker Generation, IEEE Transactions on Audio, Speech, and Language Processing, vol. 33, pp. 1364-1374, 2025
2)From Faces to Voices: Learning Hierarchical Representations for High-Quality Video-to-Speech, CVPR, 2025 (Highlight Presentation)
3)Faces that Speak: Jointly Synthesising Talking Face and Speech from Text, CVPR, 2024
4)Let There Be Sound: Reconstructing High Quality Speech from Silent Videos, AAAI, 2024 (Oral Presentation)