바로가기 메뉴
본문 바로가기
주요메뉴 바로가기
ETRI소식 상상을 현실로, 진화하는 ICT세상, 고객과 함께 ICT미래를 열어가겠습니다.

보도자료

[2026-65호] ETRI, AI 교통영상 분석 국제대회 2개 부문 1·2위 쾌거

ETRI, AI 교통영상 분석 국제대회 2개 부문 1·2위 쾌거


- ECCV 2026 ‘AI City Challenge’ PSI-VQA 1위·FETV 2위


- CCTV·어안렌즈·차량 카메라 아우르는 통합 교통영상 AI 개발


- 30여 년 교통영상 기술에 최신 VLM 결합…교통·안전 분야 활용 기대




국내 연구진이 세계적인 인공지능(AI) 교통영상 분석 경진대회에서 2개 부문 각각 1위와 2위를 차지하며 세계 최고 수준의 기술력을 입증했다. 

CCTV부터 교차로 어안렌즈, 차량 카메라까지 서로 다른 시점에서 촬영된 영상을 하나의 AI가 이해하고 위험상황과 그 이유까지 설명하는 기술이다.

한국전자통신연구원(ETRI)은 지난 8일, 스웨덴 말뫼에서 열린 세계적 권위의 컴퓨터비전 학술대회 ‘ECCV 2026’의‘제10회 AI 시티 챌린지’에서 교통 이상상황 이해 분야의 PSI-VQA 부문 종합 1위, FETV 부문 종합 2위를 차지했다고 밝혔다.

ECCV는 컴퓨터비전과 인공지능 분야를 대표하는 세계적인 국제학술대회로, 세계 각국의 대학과 연구기관, 글로벌 기업 연구진이 최신 연구성과를 발표하고 공유하는 자리다.

ECCV에서 열리는‘AI 시티 챌린지’는 지능형 교통과 스마트시티 분야에서 AI의 실제 문제 해결능력을 겨루는 국제 경진대회다.

엔비디아(NVIDIA) 연구진을 비롯해 세계 각국의 대학·연구기관·기업 연구자들이 참여하고 있으며, 2017년 시작해 올해로 10회째를 맞았다.

특히 올해 대회에서는 학습 과정에서 접하지 못했던 새로운 환경에서도 AI가 얼마나 안정적으로 작동하는지와 서로 다른 카메라·센서 및 촬영 시점에서 확보된 영상을 얼마나 정확하게 이해하고 추론하는지를 중점적으로 평가했다.

■ 보행자 횡단의도부터 교통법규 위반까지…AI 영상추론 세계 최고 수준 입증

ETRI와 미국 워싱턴대학교(UW) 공동연구팀 ‘UWIPL_ETRI’는 보행자 횡단의도를 분석하는 PSI-VQA 부문에서 종합 1위, 교차로 교통법규 위반상황을 이해하는 FETV 부문에서 종합 2위를 기록했다. 

PSI-VQA 부문은 차량 전방 카메라 영상에서 보행자의 움직임을 분석하고 ‘보행자가 도로를 건너려고 하는가’, ‘언제 위험한 상황이 발생하는가’, ‘그렇게 판단한 근거는 무엇인가’ 등을 질의응답 방식으로 추론하는 과제다.

단순히 영상 속 사람이나 자동차를 찾아내는 객체인식을 넘어 사람의 행동 의도와 위험상황이 발생하는 시점, 판단의 이유까지 AI가 종합적으로 이해해야 한다는 점에서 고난도의 영상추론 능력이 요구된다.

FETV 부문은 교차로에 설치된 어안렌즈 카메라 영상을 분석해 신호위반, 역주행, 무단횡단 등 교통법규 위반행위를 찾아내고 해당 상황을 AI가 이해해 설명하는 과제다.

일반적인 CCTV와 달리 어안렌즈 카메라는 넓은 교차로 전체를 한 화면에 담을 수 있지만 영상의 가장자리로 갈수록 사물과 사람이 휘어져 보이는 등 영상 왜곡이 크다. 

따라서 AI가 차량과 보행자의 위치와 움직임, 상호관계를 정확하게 판단하기가 상대적으로 어렵다.

공동연구팀은 PSI-VQA 참가 7개 팀 가운데 종합 1위를, FETV 참가 8개 팀 가운데 종합 2위를 차지했다. 

공개 리더보드에는 MR-CAS, Korea Drive, MobilityAI, OptimAI, GDG, SMART Lab, FPT AI Vision, Team KODE 등 국내외 다양한 연구·기업팀이 이름을 올렸다.

공동연구팀은 서로 다른 영상 환경을 다루는 2개 부문에서 모두 최상위권에 오르며 다양한 카메라와 촬영 시점에서도 안정적으로 교통상황을 이해하고 추론할 수 있는 AI 기술력을 입증했다.

■ CCTV부터 차량 카메라까지 하나의 AI로 이해하는 ‘UniTraffic’

이번 성과의 핵심은 연구진이 개발한 통합 교통영상 이해 기술 ‘UniTraffic’이다.

기존 영상분석 AI는 CCTV, 교차로 카메라, 차량 카메라 등 촬영 장치와 영상 특성에 따라 별도의 모델을 구축하는 경우가 많았다. 

반면 UniTraffic은 천장형 CCTV, 교차로 어안렌즈 카메라, 차량 탑재 카메라 등 영상의 형태와 관찰 시점이 크게 다른 환경을 하나의 비전언어모델(VLM, Vision-Language Model) 기반 시스템으로 처리하도록 설계됐다.

비전언어모델은 영상이나 이미지의 시각정보와 언어정보를 함께 이해하고 추론하는 AI다. 기존 영상분석 AI가 ‘사람이 있다’, ‘차량이 움직인다’와 같이 객체와 행동을 찾아내는 데 집중했다면, VLM은 영상 속 상황을 종합적으로 이해하고 ‘무슨 일이 벌어졌는지’, ‘왜 위험한지’ 등을 언어로 설명할 수 있다.

UniTraffic은 먼저 전체 영상을 빠르게 분석한 뒤 보행자의 움직임이나 차량의 진로 변경처럼 보다 세밀한 판단이 필요한 부분만 다시 집중적으로 분석하는 방식을 활용한다.

사람이 긴 영상을 볼 때 처음부터 모든 장면을 똑같이 자세하게 보는 대신 전체 흐름을 먼저 파악하고 중요한 순간을 다시 살펴보는 것과 유사한 방식이다.

이를 통해 긴 교통영상을 보다 효율적으로 분석하면서도 중요한 위험상황을 정밀하게 판단할 수 있다.

연구진은 영상에서 확인한 장면과 객체, 행동, 발생 시점 등을 서로 연결한 ‘교통 증거 그래프(Traffic Evidence Graph)’도 구성했다.

예컨대 AI가 ‘보행자가 횡단하려 한다’고 판단할 경우 보행자의 위치와 이동 방향, 주변 차량의 움직임, 해당 행동이 발생한 시점 등 실제 영상 속 근거를 서로 연결해 판단하도록 한 것이다. 

이를 통해 AI가 영상에 존재하지 않는 내용을 사실처럼 만들어내는 오류를 줄이고 판단 결과의 신뢰성과 설명 가능성을 높였다.

■ AI가 AI의 판단 다시 확인…오류 줄이고 신뢰성 높여

연구진은 서로 다른 계열의 VLM을 각각 ‘제안 모델’과 ‘검증 모델’로 활용하는 교차검증 방식도 적용했다.

하나의 AI가 영상분석 결과를 제안하면 다른 AI가 실제 영상 속 근거와 일치하는지를 다시 확인하도록 한 것이다. 

검증 과정에서 충분한 영상 증거가 확인될 경우에만 판단을 수정하도록 해 특정 AI 모델에서 발생한 오류가 최종 결과에 그대로 반영될 가능성을 낮췄다.

특히 연구진은 FETV와 PSI-VQA처럼 서로 다른 문제를 해결하기 위해 부문마다 새로운 AI 모델을 별도로 구축하는 대신 동일한 학습 가중치와 기본 추론체계를 활용했다.

이는 특정 카메라나 데이터에만 최적화된 AI가 아니라 새로운 센서와 촬영 시점에서도 적용할 수 있는 ‘일반화 능력’을 높였다는 의미다.

향후 스마트시티에서 새로운 CCTV나 차량 카메라 등이 추가될 때마다 처음부터 별도의 AI를 개발해야 하는 부담을 줄이는 데에도 도움이 될 것으로 기대된다.

■ ETRI 30여 년 교통영상 AI 기술에 최신 VLM 접목

이번 성과의 바탕에는 ETRI가 지난 30여 년간 축적해 온 지능형 교통관제와 영상분석 기술이 있다.

ETRI는 스마트시티와 지능형 교통체계 분야의 국가연구개발을 수행하면서 CCTV 영상분석, 객체인식 및 추적, 사람과 차량의 행동분석 등 관련 기술을 꾸준히 개발해 왔다.

특히 실제 교통·도시 환경에서 발생하는 복잡한 영상 데이터를 처리하면서 축적한 현장경험과 기술적 노하우가 최신 AI 기술의 기반이 됐다.

연구진은 선배 연구진으로부터 이어져 온 객체인식·추적·행동분석 기술에 최신 VLM의 언어추론 능력과 영상 증거검증 기술을 결합했다.

과거 영상 속 ‘사람과 자동차를 정확하게 찾는 AI’에서 출발해 이제는 ‘사람과 자동차가 무엇을 하고 있으며, 어떤 위험이 발생할 수 있고, 왜 그렇게 판단했는지를 설명하는 AI’로 기술을 발전시킨 셈이다.

아울러 미국 워싱턴대학교 연구진과의 국제공동연구를 통해 서로의 영상분석·AI 기술을 결합하고 세계적인 연구팀들과 경쟁하면서 기술의 성능과 범용성을 검증했다.

■ 교통관제·보행자 안전·자율주행까지 활용

이번 기술은 향후 ▲지능형 CCTV 관제 ▲교차로 위험행동 조기경보 ▲보행자 안전지원 ▲교통법규 위반 분석 ▲자율주행차 위험상황 이해 등 다양한 교통·안전 분야에 활용할 수 있을 것으로 기대된다.

예를 들어 교차로 CCTV에서 보행자가 갑자기 도로로 진입하거나 차량이 비정상적인 움직임을 보일 경우 AI가 단순히 이상상황을 감지하는 데 그치지 않고 ‘어떤 상황이 발생했는지’와 ‘왜 위험한지’를 함께 설명함으로써 관제요원의 신속한 판단을 도울 수 있다.

자율주행 분야에서도 차량 전방 영상에 등장한 보행자의 이동 방향과 주변 상황을 종합적으로 분석해 보행자가 도로를 횡단할 가능성과 위험 시점을 판단하는 데 활용할 수 있다.

연구진은 향후 기존의 경량 영상분석 AI가 전체 영상을 실시간으로 빠르게 처리하고, 판단이 어렵거나 추가적인 설명이 필요한 장면에만 고성능 VLM을 선택적으로 적용하는 방식으로 기술을 고도화할 계획이다.

이를 통해 VLM 활용에 필요한 연산량과 비용을 줄이면서도 중요한 위험상황에 대해서는 보다 정밀한 분석과 설명을 제공하는 실용적인 교통영상 AI 시스템을 구현한다는 계획이다.

향후 국내 교통관제·영상보안 기업 및 스마트시티 관련 사업자 등과 협력해 실제 교통환경에서 기술을 검증하고 사업화 가능성도 모색할 예정이다.

이번 대회에는 ETRI 대경권연구본부 AI인프라연구실 김상원 연구원, 김병근 책임연구원, 김광주 선임연구원과 미국 워싱턴대학교 Jianxu Shangguan 연구원, Jenq-Neng Hwang 교수가 공동연구진으로 참여했다.

김상원 연구원과 Jianxu Shangguan 연구원은 ECCV 2026 AI City Challenge 워크숍에서 이번 연구성과와 기술을 공동으로 발표했다.

ETRI 변우진 대경권연구본부장은 “이번 성과는 선배 연구진이 오랜 기간 축적해 온 지능형 교통관제와 영상분석 기술을 계승하고, 국제공동연구를 통해 최신 AI 기술로 발전시킨 결과라는 점에서 의미가 크다”며 “세계적인 대회를 통해 기술력을 입증한 만큼 앞으로 실제 교통현장 실증과 국내 기업과의 협력을 확대해 국민이 체감할 수 있는 교통·안전 서비스로 발전시키겠다”고 말했다.

ETRI는 이번 성과를 바탕으로 다양한 카메라와 교통환경에서도 안정적으로 작동하고 판단 근거까지 설명할 수 있는 교통영상 AI 기술을 지속적으로 고도화해 지능형 교통관제와 스마트시티, 자율주행 등 다양한 분야로 적용 범위를 확대할 계획이다.<보도자료 본문 끝>


TOP