전체 글 108

가끔 복습하는 딥러닝(3)

손실 함수 - 예측값과 실제값 사이의 차이를 수치화, 이 오차값을 최소화하는 방향으로 보통 모델을 학습 Negative Log-Likelihood: 딥러닝에서 주로 사용되는 손실함수 더보기 - 모델을 학습시키기 위해 최대우도추정(Maximum Likelihood Estimation)을 하는데, 우리는 주어진 데이터만으로 특정 미지의 최적 모델의 파라미터 값인 θ">θ를 찾아야 한다. 여기서 Likelihood, 우도란 입력값 X와 이 파라미터 θ가 주어졌을 때 정답값인 Y가 나타낼 확률인 P(Y|X;θ)를 최대화하는 θ이다.- 그렇다면 왜 네거티브일까? argmax가 아닌 argmin값을 사용하는 이유는 결국 이 값을 최대화하는 것이나, 최소화하는 것이나 소프트맥수 함수 등을 취하면 결과는..

가끔 복습하는 딥러닝(2)

일반적인 모델 학습 목표- Training Error와 Tesst Error를 최소화하는 것. 이를 평가하는 관점으로 Underfitting / Overfitting / Generalization으로 구분Underfitting(과소적합)- 데이터 구조를 제대로 학습하지 못하는 상황. Training/Test Error ↑. 모델을 너무 적게 학습(제대로 Target 예측을 하지 못함)Overfitting(과적합)- 데이터의 노이즈까지 외워버리는 상황. Training Error ↓, Test Error ↑. 모델을 과하게 학습(데이터가 바뀌면 틀림) Generalization (일반화)- 모델이 학습 데이터뿐 아니라 새로운 데이터에서도 낮은 오류를 유지하는 능력따라서, 모델의 학습 목표는 좋은 일반화 성..

가끔 복습하는 딥러닝(1)

딥러닝- 현상을 대표하는 Representation을 Learning하는 것. 전통적인 ML보다 이상치에 둔감하고, 더 많은 학습 데이터 샘플이 필요딥러닝은 본질적으로는 AI 영역에서 머신러닝의 하위 부분집합에 속한다.- 개와 고양이를 분류(Classification)하는 문제- 주식 종가 예측에 어떤 변수들이 영향을 주었는 가에 관한 회귀(Regression) 문제- 공정 문제에서의 이상치 탐지(Anomaly detection) 등이 이에 속한다.이러한 문제들은 지도 학습(입력에 대한 정답이 존재) 기법이나 비지도 학습(입력은 존재하나, 정답은 없는), 준지도 학습(지도 학습과 비지도의 중간 정도)로 구분된다.

LLM component(1): Residual Connection(작성중)

0. LLM workflow1)입력 인베딩 -> 2)트랜스포머 블록(멀티 헤드 어텐션, 피드포워드 네트워크, 잔차 연결 및 정규화) -> 3)출력 레이어 4) 출력 디코딩1. 정의Residual Connection은 신경망에서 발생하는 기울기 소실(vanishing gradient) 문제를 해결하기 위해 도입되었다.신경망의 특정 층에서 입력값을 출력값에 더해주는 방식인데, 어떤 변환을 수행한 F(X)에원래 입력값인 X를 더해 최종 출력을 만든다. Y = F(X) + X ## 트랜스포머 블록 구조 상 멀티 헤드 어텐션(출력)과 피드 포워드 네트워크(출력과 입력)에 적용import torchimport torch.nn as nnclass FeedForwardNetwork(nn.Module): def _..

스터디/AI 2025.03.05

할루시네이션(2): LLM-Check: Investigating Detection of Hallucinations in Large Language Models

Summary해당 논문은 할루시네이션 탐지 방법 중 모델 튜닝을 하지 않고 single response를 활용한 방법이다.출력 토큰 생성 시 attention map과 hidden_state, output prediction probabilities 값을 사용하여 불확실한 토큰(할루시네이션한 답변) 탐지에 집중하였다.(NuerIPS 2024, Sriramanan et al.)Contributions  1) Model inner states를 활용한 저비용 할루시네이션 탐지 방법 제안 2) 기존에 연구되어 오던 반복 샘플링 기반  할루시네이션 측정방법과 외부지식 활용방법 보다 우수함을 증명 Introduction저자는 LLM 할루시네이션 탐지 방법 중 uncertainty estimation 방법론에 집중..

스터디/논문 2025.02.13

할루시네이션(1): KNOWHALU: HALLUCINATION DETECTION VIA MULTI-FORM KNOWLEDGE BASED FACTUAL CHECKING

Background해당 논문은 할루시네이션 탐지 방법 중 프롬포트 기반 Method와 RAG를 적절하게 결합한 논문이다. (LLM 할루시네이션 문제 해결을 위해 모델 내부지식 또는 외부지식 개입으로 해결하려는 방법론을 결합하였다) Contributions  1) 구체적이지 않은 할루시네이션을 탐지하는 기법과 단계적 사실 확인기법(유사 COT와 RAG) 프레임워크 제안 2) 환각 탐지에 사용되는 쿼리를 공식화하여 World knowledge와의 관계를 탐구 3) 예측결과에 대한 단계별 검증으로 환각의 영향을 줄이고, 기존 SOTA 모델 대비 QA task의 좋은 성능 확보Introduction해당 논문의 저자는 LLM 할루시네이션 탐지를 위해 기존에 수행된 Response의 자기일관성 연구, LLM 히든 ..

스터디/논문 2025.01.26

Unlearning 리뷰(1): A PROBABILISTIC PERSPECTIVE ON UNLEARNING AND ALIGNMENT FOR LARGE LANGUAGE MODELS

Background해당 논문은 Unlearning 관련 방법과 평가지표에 대해 살펴보던 중선행연구의 잊힘의 정도를 파악하는 평가지표가 정성적으로 적합하지 않다 생각하여 찾아보게 되었다.  Contributions  1) 확률론적 관점에서 LLM 언러닝을 평가하는 프레임워크와 평가지표 제안 2) Greedy decoding 기반 점 추정은 결정론적 평가법에서 안전하다 생각하지만 데이터 누수 발생 가능 3) 다항샘플링 시 추출될 수 있는 정보들을 제대로 지우기 위해 엔트로피 최적화와 온도 스케일링 기법 제안Introduction해당 논문의 저자는 AI safety 관점에서 LLM에서의 최종 output 값을 평가하는 결정론적 평가기법을 지적한다.모델의 출력 분포가 아닌 단일값에 집중하는 것은 LLM 모델 공..

스터디/논문 2024.12.14

대학원생 일기(1): 입학 환영회부터 중간고사까지

후기 대학원 중간고사까지의 삶후기는 애매한 시즌이다. 추석부터 시작해서 각종 공휴일이 많기에, 지도교수님의 터치가 적다.내가 무엇을 해야할 지 명확히하지 않고 입학하고 보니, 연구실에서 국제적인 미아가 되었다.그저 시간의 흐름대로 눈을 뜨고, 눈을 감고. 드문드문 연구실 학생들과 친해지려 노력해보고.내가 더 나아지기 위한 시간을 매일 고민했었다. 하루 아침에 되진 않겠지만막연히 정한 연구 주제인 추천시스템은 추진력과 설득력이 부족했고.결국 다른 주제를 선택해보라는 교수님의 방침을 받았다. 연구실 인턴을 했으면 제때 출발할 수 있었을 텐데 아쉬웠다.합류하게 된 연구실에서 교수님의 지도 학습을 매일 받지 못하는 상황이라. 사실 어렵기도 하고.매주 한 번 가지는 미팅 시간이 나에겐 엄청나게 소중했다. 더 많이..

심화기계학습: 차원축소

차원축소 분류: 변수선택과, 변수추출[선형, 비선형 기법)변수선택 기법Hughes Phenomenon: 훈련 데이터 수에 비해 차원이 증가할 수록 모델 성능이 점차 감소(데이터 밀도감소) 대표적인 차원 축소기법더보기PCA목적: 데이터 차원 축소와 최대한의 분산 보존.주성분: 공분산 행렬에서 가장 큰 고유값을 갖는 고유벡터의 방향으로 정의(이 벡터들은 서로 직교하며 데이터들의 선형결합으로 표현)왜 직교하는가?중복 정보를 제거하고, 각 저성분이 독립적으로 데이터를 설명하기 위해적용: 1) 데이터 행렬의 평균을 0으로 정규화 2) 공분산 행렬 계산 및 고유값, 고유벡터 계산 3) 고유값을 크기 순으로 정렬하여 상위 k개의 고유벡터 선택 4) X를 새로운 k 차원 공간으로 투영: Z=XW 더보기Multidime..

딥러닝 유틸(1) Tmux

1. Tmux란? 터미널 멀티플렉서로, 하나의 터미널 세션에서 여러 개의 창을 관리하고, 세션을 분리하거나 재접속하는 등 유용한 기능을 제공하는 tool을 의미한다-> 즉, 우리가 모델을 돌릴 때 사용하고 있는 컴퓨터에서 여러 작업 터미널 창을 만들어 주며, tmux에 넣은 작업은 실제 작업 종료 전 까진 중단되지 않는다(작동중인 컴퓨터 종료해도 무관) 2. Tmux 구성요소: 세션(여러 터미널 창을 그룹화), 윈도우(작업 공간), Pane(독립적인 터미널 창) 3. Tmux 설치conda install -c conda-forge tmux # conda# 우분투 기반 도커 컨테이너apt-get updateapt-get install -y tmux# macOSbrew install tmux 4. 명령어# ..