KAIST, 개인정보 공유 없이 병원·은행에서도 통하는 연합학습 AI 개발

합성 데이터로 ‘지역 과적합’ 한계 극복…ICLR 2025 구두 발표(상위 1.8%) 선정

KAIST(총장 이광형) 산업및시스템공학과 박찬영 교수 연구팀이 병원·은행 등 민감한 개인정보를 다루는 기관 간에도 안정적으로 작동하는 새로운 연합학습(Federated Learning) 인공지능 기술을 개발했다. 이번 연구는 AI의 일반화 성능을 크게 높여, 의료·금융·소셜미디어 등 다양한 분야에서 협업형 AI 모델 구축의 가능성을 열었다.

연합학습은 여러 기관이 데이터를 직접 주고받지 않고, 각자의 서버에서 AI를 학습한 뒤 학습 결과만 공유해 하나의 공동 모델을 만드는 분산형 학습 방식이다. 하지만 기존 모델은 각 기관이 자체 데이터를 이용해 추가 학습(파인튜닝)할 때 공동 모델의 폭넓은 지식이 희석되며, AI가 특정 기관의 데이터에만 지나치게 적응하는 ‘지역 과적합(Local Overfitting)’ 문제가 발생했다. 예를 들어 여러 은행이 ‘공동 대출 심사 AI’를 구축한 뒤 한 은행이 대기업 고객 데이터를 중심으로 파인튜닝을 진행하면 그 은행의 AI는 대기업 심사에는 강점을 보이지만 개인이나 중소기업 심사에서는 성능이 급격히 떨어지는 현상이 나타난다.

박찬영 교수팀은 이를 해결하기 위해 ‘합성 데이터(Synthetic Data)’ 개념을 도입했다. 각 기관의 데이터를 직접 공유하지 않고, 데이터의 핵심적인 특징만 추출해 개인정보를 포함하지 않는 가상 데이터를 생성한 뒤 이를 학습 과정에 함께 활용하도록 설계했다.

연구팀은 합성 데이터를 일종의 ‘AI 백신(Vaccine)’처럼 활용했다. 각 기관이 자체 데이터를 이용해 AI를 세밀하게 조정할 때, 다른 기관들의 합성 데이터를 함께 학습시킴으로써 AI가 특정 데이터 유형에만 과도하게 맞춰지는 것을 방지하는 방식이다. 이 접근법을 적용한 결과, AI는 각 기관의 환경에 맞춰 전문성을 강화하면서도 협업을 통해 얻은 폭넓은 시야(일반화 성능)를 유지할 수 있었다. 실험에서는 의료·금융 등 보안이 중요한 분야뿐 아니라 사용자와 상품이 끊임없이 바뀌는 소셜미디어·전자상거래 환경에서도 안정적인 성능을 지속적으로 유지하는 것으로 확인됐다.

박찬영 교수는 “데이터 프라이버시를 지키면서도 각 기관의 AI가 전문성과 범용성을 동시에 확보할 수 있는 새로운 길을 제시했다”며 “의료 진단, 금융 사기 탐지 등 데이터 협업이 필수적이지만 보안이 중요한 분야에서 즉시 적용 가능한 기술”이라고 설명했다.

이번 연구 결과는 인공지능 분야 세계 최고 권위 학술대회인 ‘국제표현학습학회(International Conference on Learning Representations, ICLR) 2025’에서 상위 1.8%의 우수 논문에만 주어지는 구두 발표(Oral Presentation)로 선정됐다. 논문 제목은 『Subgraph Federated Learning for Local Generalization』https://doi.org/10.48550/arXiv.2503.03995)이다. 연구에는 데이터사이언스대학원 김성원 박사과정생이 제1저자로 참여했으며, 박 교수는 교신저자로 연구를 총괄했다. 공동 연구진에는 KAIST 산업및시스템공학과 이윤호·오윤학·이남경·이준석 박사과정생, 김세인 석박통합과정생, 미국 노스캐롤라이나대(UNC) 윤석원 박사과정생, 이모리대 칼 양(Karl Yang) 교수가 참여했다.

광고
대학
(하단왼쪽부터)KAIST이윤호박사과정,김세인석박통합과정,김성원박사과정,이준석박사과정,오윤학박사과정,(우측상단왼쪽부터)이남경박사과정, / 사진 KAIST 제공

이번 연구는 정보통신기획평가원(IITP)의 지원을 받은 ‘강건하고 공정하며 확장 가능한 데이터 중심의 연속학습’ 과제와 한국연구재단의 ‘그래프 파운데이션 모델 연구’ 및 ‘데이터사이언스융합인재양성 사업’의 성과로 수행됐다. 연구팀은 향후 의료 협진 AI, 은행 간 사기 탐지 시스템, 다중 기업 고객 서비스 분석 등 ‘데이터 프라이버시를 지키는 협업형 AI’의 실제 응용 확대를 목표로 하고 있다. 또한 그래프 데이터 기반 모델을 확장해 AI가 사용자·상품·네트워크 등 다양한 관계 구조를 동시에 이해할 수 있도록 발전시킬 계획이다. 박찬영 교수는 “이번 연구는 민감한 데이터를 보호하면서도 기관 간 협력 AI의 신뢰성과 효율성을 모두 확보할 수 있음을 보여줬다”며 “연합학습의 한계를 넘어 보안과 협업이 공존하는 AI 생태계 구축에 기여하겠다”고 말했다.

#KAIST #연합학습 #합성데이터 #ICLR2025 #AI보안 #데이터프라이버시 #박찬영교수 #스포트라이트유

Social Share

함께 읽어보세요

답글 남기기

이메일 주소는 공개되지 않습니다. 필수 필드는 *로 표시됩니다