LG, 이미지 설명하는 '캡셔닝 AI' 첫 공개

경제전체

LG, 이미지 설명하는 '캡셔닝 AI' 첫 공개

등록: 2023.06.19 오전 10:00
수정: 2023.06.19 오전 10:00

이미지의 다양한 요소와 특징을 인식해 설명글과 키워드를 생성하는 캡셔닝 AI /LG제공

LG AI연구원이 18일(현지시간) 캐나다 밴쿠버에서 진행 중인 세계 최대 컴퓨터 비전 학회 ‘CVPR(컴퓨터 비전 및 패턴 인식) 2023’에서 이미지 검색 시장에 변화를 가져올 ‘캡셔닝 AI’를 처음 공개했다고 밝혔다.

LG AI연구원이 처음으로 외부에 공개한 ‘생성형 AI’ 상용화 서비스인 ‘캡셔닝 AI’는 ‘인간처럼 처음 보는 이미지까지 자연어로 설명할 수 있는 AI’로 이미지 검색에 활용할 수 있는 정보인 문장이나 키워드 등 메타 데이터를 생성한다.

해당 기술에는 AI가 인간처럼 처음 보는 물체나 장면에 대해서도 이전의 경험과 지식을 활용해 이해하고 설명할 수 있도록 ‘제로샷 이미지 캡셔닝’ 기술이 적용됐다.

‘제로샷 이미지 캡셔닝’은 AI가 기존에 학습한 대량의 이미지와 텍스트 데이터를 기반으로 배경, 인물, 행동 등 이미지 상의 다양한 요소와 특징을 인식하고, 그 관계를 이해하고 설명할 수 있게 하는 것이 특징이다.

‘캡셔닝 AI’는 대량의 이미지를 관리해야 하는 기업들의 업무 효율성과 생산성을 높일 수 있다. ‘캡셔닝 AI’는 문장이나 단어의 길이와 개수에 따라 다르지만 평균적으로 5개 문장과 10개의 키워드를 10초 내에 생성한다. 이미지 범위를 1만 장으로 확장하면 2일 이내에 작업을 끝낼 수 있어 빠른 시간 내에 맞춤형 이미지 검색·관리 시스템 구축이 가능하다.