유재준 교수팀 기존 방식 대신 '리파인드 바이어스' 제안
![[울산=뉴시스] AI생성이미지. 고양이에 코끼리 피부를 입힌 큐컨플릭트 벤치마크의 이미지(좌)와 연구진이 제시한 벤치마크의 이미지 (사진=UNIST 제공) photo@newsis.com *재판매 및 DB 금지](https://img1.newsis.com/2026/10/01/NISI20261001_0002252726_web.jpg?rnd=20261001090248)
[울산=뉴시스] AI생성이미지. 고양이에 코끼리 피부를 입힌 큐컨플릭트 벤치마크의 이미지(좌)와 연구진이 제시한 벤치마크의 이미지 (사진=UNIST 제공) [email protected] *재판매 및 DB 금지
[울산=뉴시스] 구미현 기자 = 국내 연구진이 인공지능(AI)의 사물 인식 능력을 평가하는 표준 방식의 허점을 찾아내고 새로운 평가 기준을 제시했다.
UNIST 인공지능대학원 유재준 교수팀은 기존 AI 시각 인식 평가법인 '큐 컨플릭트(Cue-conflict)'의 구조적 문제점을 규명하고 새로운 벤치마크 '리파인드 바이어스(REFINED-BIAS)'를 제안했다고 1일 밝혔다.
이번 연구 논문은 '유럽 컴퓨터 비전 학회(ECCV2026)'에서 전체 제출 논문 1만473편 가운데 약 1.3%에 해당하는 스포트라이트 논문으로 선정됐다.
'큐 컨플릭트'는 AI가 사물을 인식할 때 형상과 표면 질감 가운데 어느 정보를 더 많이 활용하는지를 평가하는 방식이다. 고양이의 형상에 코끼리 피부 질감을 입힌 합성 이미지 등을 활용해 AI가 고양이라고 답하면 형상을 코끼리라고 답하면 질감을 활용한 것으로 평가한다.
기존 연구에서는 AI가 사람과 달리 질감에 더 의존한다는 결과가 나왔고 이를 바탕으로 AI가 형상을 중심으로 사물을 인식하도록 학습해야 한다는 주장이 제기됐다. 그러나 이후 연구에서는 형상 선호도와 실제 인식 성능의 관계를 놓고 엇갈린 결과가 나타났다.
연구팀은 이 같은 혼선의 원인이 기존 벤치마크 자체에 있다고 분석했다.
가장 큰 문제는 형상과 질감에 대한 '비율'만 평가한다는 점이다. 예를 들어 100장의 이미지에서 형상에 해당하는 답을 8번 고른 AI와 80번 고른 AI가 모두 형상 선호도 80%로 평가될 수 있다. 형상을 잘 인식한 경우와 질감을 잘 인식하지 못해 상대적으로 형상 비율이 높아진 경우를 구분하기 어렵다는 것이다.
UNIST 인공지능대학원 유재준 교수팀은 기존 AI 시각 인식 평가법인 '큐 컨플릭트(Cue-conflict)'의 구조적 문제점을 규명하고 새로운 벤치마크 '리파인드 바이어스(REFINED-BIAS)'를 제안했다고 1일 밝혔다.
이번 연구 논문은 '유럽 컴퓨터 비전 학회(ECCV2026)'에서 전체 제출 논문 1만473편 가운데 약 1.3%에 해당하는 스포트라이트 논문으로 선정됐다.
'큐 컨플릭트'는 AI가 사물을 인식할 때 형상과 표면 질감 가운데 어느 정보를 더 많이 활용하는지를 평가하는 방식이다. 고양이의 형상에 코끼리 피부 질감을 입힌 합성 이미지 등을 활용해 AI가 고양이라고 답하면 형상을 코끼리라고 답하면 질감을 활용한 것으로 평가한다.
기존 연구에서는 AI가 사람과 달리 질감에 더 의존한다는 결과가 나왔고 이를 바탕으로 AI가 형상을 중심으로 사물을 인식하도록 학습해야 한다는 주장이 제기됐다. 그러나 이후 연구에서는 형상 선호도와 실제 인식 성능의 관계를 놓고 엇갈린 결과가 나타났다.
연구팀은 이 같은 혼선의 원인이 기존 벤치마크 자체에 있다고 분석했다.
가장 큰 문제는 형상과 질감에 대한 '비율'만 평가한다는 점이다. 예를 들어 100장의 이미지에서 형상에 해당하는 답을 8번 고른 AI와 80번 고른 AI가 모두 형상 선호도 80%로 평가될 수 있다. 형상을 잘 인식한 경우와 질감을 잘 인식하지 못해 상대적으로 형상 비율이 높아진 경우를 구분하기 어렵다는 것이다.
![[울산=뉴시스] 사진 왼쪽부터 유재준 교수, 김범준 연구원, 이승아 연구원. photo@newsis.com *재판매 및 DB 금지](https://img1.newsis.com/2026/10/01/NISI20261001_0002252728_web.jpg?rnd=20261001090352)
[울산=뉴시스] 사진 왼쪽부터 유재준 교수, 김범준 연구원, 이승아 연구원. [email protected] *재판매 및 DB 금지
연구팀은 이를 개선하기 위해 형상과 질감을 각각 얼마나 잘 인식하는지를 점수로 평가하는 '리파인드 바이어스'를 제시했다.
평가 데이터는 시계와 모래시계처럼 형상이 뚜렷한 사물 10종과 얼룩말과 벌집처럼 질감이 뚜렷한 사물 10종을 선정해 총 6천장으로 구성했다. 형상 평가용 이미지는 윤곽과 내부 구조를 남기고 표면 무늬를 제거했으며 질감 평가용 이미지는 전체 형상이 드러나지 않도록 구성했다.
새로운 벤치마크로 평가한 결과 성능이 높은 AI 모델일수록 형상이나 질감 어느 한쪽에 치우치기보다 두 정보를 모두 적극적으로 활용하는 것으로 나타났다.
유재준 교수는 "벤치마크는 AI의 성능을 평가하는 데 그치지 않고 모델 개발 방향까지 제시하는 만큼 제대로 된 평가 기준을 마련하는 것이 중요하다"며 "이번 벤치마크가 AI의 형상과 질감 인식 능력을 정확하게 진단하고 모델 구조와 학습 방법을 개선하는 데 도움이 되기를 기대한다"고 말했다.
이번 연구에는 UNIST 인공지능대학원 김범준 연구원과 이승아 연구원이 공동 제1저자로 참여했다.
◎공감언론 뉴시스 [email protected]
평가 데이터는 시계와 모래시계처럼 형상이 뚜렷한 사물 10종과 얼룩말과 벌집처럼 질감이 뚜렷한 사물 10종을 선정해 총 6천장으로 구성했다. 형상 평가용 이미지는 윤곽과 내부 구조를 남기고 표면 무늬를 제거했으며 질감 평가용 이미지는 전체 형상이 드러나지 않도록 구성했다.
새로운 벤치마크로 평가한 결과 성능이 높은 AI 모델일수록 형상이나 질감 어느 한쪽에 치우치기보다 두 정보를 모두 적극적으로 활용하는 것으로 나타났다.
유재준 교수는 "벤치마크는 AI의 성능을 평가하는 데 그치지 않고 모델 개발 방향까지 제시하는 만큼 제대로 된 평가 기준을 마련하는 것이 중요하다"며 "이번 벤치마크가 AI의 형상과 질감 인식 능력을 정확하게 진단하고 모델 구조와 학습 방법을 개선하는 데 도움이 되기를 기대한다"고 말했다.
이번 연구에는 UNIST 인공지능대학원 김범준 연구원과 이승아 연구원이 공동 제1저자로 참여했다.
◎공감언론 뉴시스 [email protected]
