권기택 Gitaek Kwon
AI Research Scientist
Computer Vision · Research & Production
VUNO Inc.에서 컴퓨터 비전 연구원으로 일하며, 학습을 마친 모델과 실제 제품 사이의 간극을 메우는 문제를 해결하고 있습니다.
주요 연구 관심사는 소량·불균형 데이터 학습, OOD(Out-of-Distribution) 탐지, 그리고 생성 모델을 활용한 데이터 증강입니다. 의료 영상 도메인을 중심으로 ICLR, MICCAI, BMVC, ISBI 등에서 논문을 발표하였으며, 연구 단계의 모델이 실제 서비스에 안착할 수 있도록 추론 최적화 및 릴리즈 자동화 전반을 함께 다룹니다. 최근에는 VLM과 LLM 에이전트 기술을 탐구하며 연구 영역을 확장하고 있습니다.
Email GitHub Google Scholar CV
주요 논문
전체 논문 →
ICLR 2026
Frequency-Balanced Retinal Representation Learning with Mutual Information Regularization
MAE가 배경에 해당하는 저주파 정보에 치우쳐 판별에 필요한 고주파 구조를 충분히 학습하지 못하는 문제를 다뤘습니다. 고주파 정보와 인코더 표현 사이의 상호정보량을 높이는 정규화 항을 목적함수에 추가했습니다.
MICCAI 2024
Semi-supervised Segmentation through Rival Networks Collaboration with Saliency Map in Diabetic Retinopathy
BMVC 2023공동 1저자구두 발표
Improving Out-of-Distribution Detection Performance using Synthetic Outlier Exposure Generated by Visual Foundation Models
MICCAI 2022제1저자챌린지 우승
Bag of Tricks for Developing Diabetic Retinopathy Analysis Framework to Overcome Data Scarcity
ICLR 2020
Generalized Convolutional Forest Networks for Domain Generalization and Visual Recognition
랜덤 포레스트는 개별 트리의 분류력을 높이면 트리 사이의 예측도 비슷해지는 문제가 있습니다. 트리의 분할 분포에서 triplet을 샘플링해 같은 클래스는 가깝게, 다른 클래스는 멀어지도록 특징 공간을 학습했습니다.
수상
전체 이력 →-
1위 · JustRAIGS — AI Glaucoma Screening Challenge ISBI 2024
37개국 322명이 참가했고, 최종 phase 20팀 중 종합 1위를 기록했습니다. 태스크는 의뢰 필요 여부를 판단하는 이진 분류와 10개 세부 특징을 판별하는 다중 라벨 분류였습니다.
-
1위 · DRAC22 — Diabetic Retinopathy Analysis Challenge MICCAI 2022
미세 구조 다중 클래스 분할, 이미지 품질 분류, 중증도 등급 분류의 3개 태스크로 구성됐으며 전 부문 1위를 기록했습니다.
-
동상 · ACM-ICPC Korea Regional ACM
특허
전체 특허 →-
병변 정보 제공 방법 및 장치
출원 · 10-2023-0184784
-
이미지의 스타일을 전이하는 방법 및 이를 위한 장치
등록 · 10-2592666
-
하드 네거티브 마이닝을 이용한 객체 추적 방법
등록 · 10-2224101
직접 만든 것
전체 포스트 →-
pocket-vlm — 4B VLM을 2.6GB로 줄여 노트북 CPU에서 돌리기
양자화가 판독 정확도를 어디서 무너뜨리는지 같은 검증셋 319문항으로 측정했습니다 — 8→4비트는 사실상 무손실, 절벽은 딱 한 곳
-
fundus-vlm — 오픈 VLM으로 안저 스크리닝 리포트 만들기
오픈 VLM의 안저 판독 능력을 정량 측정하고, QLoRA로 전문 CNN급까지 끌어올리고, 구조화 리포트 생성·서빙까지 — 공개 데이터만으로
-
한국어 차트를 못 읽는 VLM, 7일 만에 고치기
진단부터 QLoRA 파인튜닝, vLLM 서빙까지 풀사이클 — val 70.2% → 96.6%
-
Artiview — 코딩 에이전트가 쏟아내는 HTML을 위한 로컬 갤러리
에이전트 산출물이 디스크와 서버에 수백 장 쌓이기 시작했을 때, 사진 앱처럼 훑어보고 본문으로 검색하는 데스크톱 앱을 만들었습니다