Why Language Models Hallucinate 리뷰 - 모를 때도 추측하는 이유
이 논문은 hallucination이 생기는 지점과 사라지지 않는 이유를 나눈다. 사전학습에서는 유효한 문장과 그럴듯한 오류를 구분하기 어려운 통계적 조건 때문에 생성 오류가 생기고, 사후학습과 평가에서는 불확실성을 밝히는 것보다 추측하는 편이 높은 점수를 받기 때문에 오류가 답변...
이 논문은 hallucination이 생기는 지점과 사라지지 않는 이유를 나눈다. 사전학습에서는 유효한 문장과 그럴듯한 오류를 구분하기 어려운 통계적 조건 때문에 생성 오류가 생기고, 사후학습과 평가에서는 불확실성을 밝히는 것보다 추측하는 편이 높은 점수를 받기 때문에 오류가 답변...
대부분의 weight를 정확히 0으로 둔 Transformer를 처음부터 학습하면, 특정 동작을 담당하는 circuit이 dense model보다 훨씬 작고 분리된 형태로 나타난다. 이 논문은 weight sparsity를 압축 기법이 아니라 해석 가능한 계산 구조를 유도하는 in...
Dragon Hatchling(BDH)은 attention과 working memory를 고차원 tensor 연산으로만 보지 않고, neuron-pair의 국소 상호작용과 synapse 변화로 다시 표현하려는 language model architecture다. 논문의 핵심은 실제...
LLaMA는 7B, 13B, 33B, 65B 규모의 decoder-only foundation language model이다. 공개적으로 구할 수 있는 data만 사용하면서 작은 model을 기존의 compute-optimal 기준보다 훨씬 오래 학습해, inference cost...
GPT-3는 175B parameter의 autoregressive language model을 task별로 fine-tuning하지 않고, instruction과 example을 context에 넣는 것만으로 여러 task에 적응시킨다. 핵심은 GPT-2보다 약 100배 큰 mo...
T5(Text-to-Text Transfer Transformer)는 분류, 질의응답, 요약, 번역처럼 입출력 구조가 다른 NLP 과제를 모두 text → text 문제로 바꾼다. 이 논문은 새로운 attention block을 제안하기보다 하나의 학습 interface 안에서 a...
GPT-2는 task별 supervised training 없이, 다양한 web text로 학습한 language model 하나가 여러 NLP task를 수행할 수 있는지 시험했다. GPT-1이 pretrained representation을 task마다 fine-tuning했다...
GPT-1은 대규모 unlabeled text로 Transformer language model을 먼저 학습한 뒤, labeled data가 있는 downstream task에 맞게 model 전체를 fine-tuning하는 두 단계 framework를 제시했다. 지금은 익숙한 방...
DeepSeek-V4는 100만 토큰 context를 처리하기 위해 attention 하나만 바꾼 모델이 아니다. Residual connection, MoE, optimizer, kernel, KV cache, RL rollout과 post-training을 같은 목표에 맞춰 함...
일반적인 언어 모델은 각 위치에서 바로 다음 token 하나를 예측한다. Multi-token Prediction(MTP)은 같은 context representation으로 앞으로 올 여러 token을 함께 맞히도록 학습한다.
SkillOpt-Sleep을 실제 코딩 에이전트의 작업형 skill에 연결해 전체 사이클을 돌려봤다. 세션 수집부터 후보 규칙 생성, held-out gate, staging과 수동 적용까지 pipeline은 정상 작동했다.
Muon은 SGD momentum이 만든 2차원 행렬 update를 Newton–Schulz iteration으로 근사 직교화한 뒤 weight에 적용하는 optimizer다. 이름도 MomentUm Orthogonalized by Newton-Schulz에서 왔다.