본문 바로가기

전체 글

(14)
Hugging Face 모델 또는 데이터 다운로드 방법 바야흐로 AI시대. 이제 허깅페이스 아는 일반인들도 조금 늘어나지 않았을까? 조금 더 욕심있는 사람들은 직접 모델을 다운로드 받아서 사용해보고 싶지않을까? 사실 다운로드 받고 사용하려는 순간 프로그래밍 언어와 조우해야하기에 엄청 관련없는 사람이 아니면 굳이 하진 않을 듯하다. 재미로 여러 AI 모델 찍먹해보는건 허깅페이스의 space를 이용하면 될 일. 나도 교수님이 급하게 다른 모델 실험 결과를 요청할 때 잘 써먹곤 한다. 다만 일정 기간이 지나면 Runtime error가 떠서 사용 못하게 되는 모델들이 종종 있음. 만약 Error가 아니라 Sleep이라면 start 누르면 정상화되는 경우가 있긴함.실험해보고자 하는 AI모델의 공식 github을 git clone하고 그 모델의 weight 파일을 다..
Visual Grounding 벤치마크 데이터셋 (RefCOCO/RefCOCO+/RefCOCOg 등) Visual grounding 관련 논문 세미나를 몇 개 했다. Visual grounding 은 결국 text description이 지칭하는 object를 localization 하는 task이다. 이 localization 방법에 따라 REC, RES로 나뉜다. 우리가 익히 아는 bounding box로 detection을 하면 REC(Referring Expression Comprehension), mask로 segmentation을 하면 RES(Referring Expression Segmentation)이다.딥러닝 분야는 워낙 빠르게 성장했고 또 빠르게 변화하는 필드라 그런지 비슷한 task에 대해 여러가지 이름이 붙는다. 가령 LLaVA나 Gemini, DeepSeek 이런 것들이 MLLM으..
SAM 3 사용해보기: 자유롭게 텍스트로 마스크를 얻어보자 promptable segmentation을 정의한 SAM, 그리고 비디오 도메인으로 확장한 SAM 2 에 이어 얼마전에 SAM 3가 나왔다. 이 업계는 왜 이렇게 빠르게 진행되는지.. 슬로우 러너(learner 그리고 runner)인 나는 너무 힘들다🥲현재 ICLR 2026 proceeding 중이며 open review의 초기 rating을 보니 무난하게 accept을 예상한다.바로 어제 교수님과 연구실 동료들 앞에서 SAM 3 세미나를 진행하였다. 내 연구는 Video domain은 아니라 Tracker 보다는 Detector 위주의 설명을 하긴 했지만, Tracker 쪽은 SAM 2의 아키텍쳐를 가져온 거라서 크게 새로운 건 없었다 (Neck 추가한 정도?).SAM, SAM2의 경우 이론상으로는..
[논문 리뷰] DASC: Dense Adaptive Self-Correlation Descriptor for Multi-modal and Multi-spectral Correspondence (CVPR'15) 현재 KAIST AI대학원 교수로 재직 중인 김승룡 교수님의 첫 CVPR논문Dense correspondence를 위해 어떻게 descriptor를 잘 설계할 것인지에 대한 연구LSS(Matching local self-similarities across images and videos) 논문을 먼저 읽는게 이해하기 쉬움dense discriptor를 어떻게 잘 뽑아낼 수 있을까에 대한 연구LSS(Local Self-Similarity)의 한계를 지적하고 local window 내 center-patch를 고정하지 않고 임의의 두 patch를 샘플링논문링크: https://openaccess.thecvf.com/content_cvpr_2015/papers/Kim_DASC_Dense_Adaptive_201..
비디오 영상 생성 모델(Video generation AI) 평가 방법 1. 픽셀, 저수준 품질 지표MSE / PSNRMSE (Mean Squared Error)원본 프레임 $x$와 생성 프레임 $\hat x$의 화소별 차이를 제곱해 평균한 값. 값이 작을수록 원본과 유사하다는 뜻이지만, 지각적 품질과는 반드시 상관관계가 높지 않음$$ \mathrm{MSE} = \frac{1}{N}\sum_{i=1}^N (x_i - \hat x_i)^2 $$PSNR (Peak Signal-to-Noise Ratio)MSE를 로그 스케일로 변환한 지표로, 높을수록(보통 20–40 dB 범위) 원본과의 차이가 적음을 의미dB: 데시벨PSNR이 20 dB라면 “최댓값²이 MSE보다 100배 크다(10²)”는 의미40 dB면 “10 000배 크다(10⁴)”는 뜻$$ \mathrm{PSNR} = 1..
pymanopt 는 어떤 라이브러리인가? 매니폴드란? 📌 pymanopt란?pymanopt는 Riemannian Manifold Optimization (리만 매니폴드 최적화)을 위한 Python 라이브러리입니다.즉, 일반적인 유클리드 공간이 아닌 manifold 위에서의 최적화를 수행하는 데 사용됩니다.✅ 주요 기능:manifold 기반 최적화: 유클리드 공간에서 벗어나 매니폴드 위에서 최적화 가능자동 미분 지원: autograd, PyTorch, TensorFlow, JAX 등과 연동 가능여러 최적화 알고리즘 제공: Steepest Descent, Conjugate Gradient, Trust Regions 등 지원다양한 다양체 제공: Stiefel, Grassmann, Sphere 등 다양한 공간을 모델링 가능 📌 매니폴드(Manifold)란?1️..
Spectral Graph Theory | Adjacency Matrix의 거듭제곱의 의미 Question어떤 그래프 $G(V, E)$의 adjacency matrix는 $n×n$ matrix $A = [a_{i,j}]$이다.$$a_{i, j} = \begin{cases} 1, & \text{if } v_i, v_j  \in E(G) \\ 0, & \text{otherwise} \end{cases}$$ 이러한 행렬이 있을 때 이 행렬의 거듭제곱의 의미는 무엇인지 설명해 보시오. 즉 $A_k$ 에서 $a^{(k)}_{i, j}= p$는 무슨 의미인지 설명하시오. Answer$a^{(k)}_{i, j}= p$ 는 정점 $v_i$에서 정점 $v_j$까지 정확히 k 길이의 경로(path)가 p개 존재한다는 의미입니다.그래프 G의 인접행렬 A를 거듭제곱했을 때, $A^k$의 $(i, j)$ 원소(즉 $..
segmentation metric 중 aAcc pAcc mAcc 차이 + mIoU aAcc / pAcc (전체 정확도, Global Accuracy):전체 이미지의 모든 픽셀 중 올바르게 분류된 픽셀의 비율을 나타냄.즉, 클래스의 픽셀 수에 관계없이 전체 픽셀 단위로 평가mAcc (클래스별 평균 정확도, Mean Accuracy):각 클래스별로 올바르게 분류된 픽셀의 비율을 계산하여 평균을 구함따라서 각 클래스의 성능을 개별적으로 평가하여, 픽셀 수가 적은 클래스도 공평하게 반영함이 차이 때문에 클래스 간 픽셀 수의 불균형이 있을 경우 aAcc는 주로 픽셀 수가 많은 클래스에 의해 높게 나타날 수 있고, mAcc는 모든 클래스를 균등하게 고려하므로 상대적으로 낮게 나타날 수 있음예를 들어 아래와 같은 결과가 나왔을 때,aAcc: 45.49 mIoU: 24.48 mAcc: 46.05결과..