Paper Review

DeepConf 논문 리뷰 - Token Confidence로 Reasoning Trace 고르기

5 분 소요

DeepConf는 같은 문제에서 여러 reasoning trace를 생성한 뒤 모두 같은 표로 세지 않고, 모델의 token probability에서 얻은 confidence로 경로를 평가하는 test-time scaling 방법이다. 별도 학습이나 외부 verifier 없이 완성...

Why Language Models Hallucinate 리뷰 - 모를 때도 추측하는 이유

6 분 소요

이 논문은 hallucination이 생기는 지점과 사라지지 않는 이유를 나눈다. 사전학습에서는 유효한 문장과 그럴듯한 오류를 구분하기 어려운 통계적 조건 때문에 생성 오류가 생기고, 사후학습과 평가에서는 불확실성을 밝히는 것보다 추측하는 편이 높은 점수를 받기 때문에 오류가 답변...

Weight-sparse Transformer 리뷰 - 해석 가능한 Circuit을 학습하기

5 분 소요

대부분의 weight를 정확히 0으로 둔 Transformer를 처음부터 학습하면, 특정 동작을 담당하는 circuit이 dense model보다 훨씬 작고 분리된 형태로 나타난다. 이 논문은 weight sparsity를 압축 기법이 아니라 해석 가능한 계산 구조를 유도하는 in...

T5 논문 리뷰 - 모든 NLP Task를 Text-to-Text로 통일하기

4 분 소요

T5(Text-to-Text Transfer Transformer)는 분류, 질의응답, 요약, 번역처럼 입출력 구조가 다른 NLP 과제를 모두 text → text 문제로 바꾼다. 이 논문은 새로운 attention block을 제안하기보다 하나의 학습 interface 안에서 a...

DeepSeek-V4 리뷰 - 100만 토큰 Architecture와 System

10 분 소요

DeepSeek-V4는 100만 토큰 context를 처리하기 위해 attention 하나만 바꾼 모델이 아니다. Residual connection, MoE, optimizer, kernel, KV cache, RL rollout과 post-training을 같은 목표에 맞춰 함...

[Review] Qwen2.5-Omni Technical Report

4 분 소요

Qwen2.5-VL을 정리한 뒤, 오디오까지 함께 다루는 모델이 어떻게 구성되는지 궁금해서 Qwen2.5-Omni Technical Report를 중심으로 스터디 내용을 정리했다.

[Review] Qwen2.5-VL Technical Report

4 분 소요

요즘 AI 서비스들은 대부분 이미지 인식 기능을 탑재하고 있다. 과연 이런 멀티모달 VLM은 실제로 어떤 모델 구조를 가지고 있을까?

[Review] Attention Is All You Need

5 분 소요

기존 sequence 변환 모델은 RNN 또는 CNN 기반의 인코더-디코더 구조를 바탕으로 한다. 최고 성능의 모델들은 여기에 attention mechanism 을 사용하고 있는데, 우리는 RNN과 CNN을 배제한 채 attention mechanism 만을 사용하는 새로운 구조...

맨 위로 이동 ↑