Multi-token Prediction 논문 리뷰 - 한 위치에서 여러 미래 토큰을 학습하기
일반적인 언어 모델은 각 위치에서 바로 다음 token 하나를 예측한다. Multi-token Prediction(MTP)은 같은 context representation으로 앞으로 올 여러 token을 함께 맞히도록 학습한다.
일반적인 언어 모델은 각 위치에서 바로 다음 token 하나를 예측한다. Multi-token Prediction(MTP)은 같은 context representation으로 앞으로 올 여러 token을 함께 맞히도록 학습한다.
SkillOpt-Sleep을 실제 코딩 에이전트의 작업형 skill에 연결해 전체 사이클을 돌려봤다. 세션 수집부터 후보 규칙 생성, held-out gate, staging과 수동 적용까지 pipeline은 정상 작동했다.
DeepSeek-V4는 100만 토큰 context를 다루기 위해 attention, residual stream, optimizer, MoE system을 함께 바꿨다. Sequence 전체를 원본 해상도로 보지 않고 CSA와 HCA로 압축한다.
MCP(Model Context Protocol)는 AI 애플리케이션과 외부 기능이 도구·리소스·프롬프트를 주고받는 규약이다. 메시지는 JSON-RPC 2.0으로 표현하고, 로컬에서는 stdio, 원격에서는 Streamable HTTP로 옮긴다.
JSON-RPC 2.0은 원격 함수를 호출하는 메시지를 JSON 객체로 표현하는 규약이다. 요청과 응답의 모양은 정하지만, 그 JSON을 HTTP로 보낼지 표준입출력으로 보낼지는 정하지 않는다.
Docker 명령은 하나씩 보면 단순하지만 run, start, exec, attach처럼 비슷한 명령이 많아 다시 찾게 된다. 자주 쓰는 명령을 이미지, 컨테이너, 네트워크, 저장소, Compose 순서로 묶었다.
SkillOpt를 설치하면 두 가지 경로를 선택할 수 있다. 연구용 trainer는 benchmark를 준비해 skill 문서 전체를 훈련하고, SkillOpt-Sleep은 코딩 에이전트의 과거 세션에서 작은 개선 규칙을 제안한다.
SkillOpt는 모델 가중치를 고정한 채 에이전트의 skill 문서를 최적화한다. 실패한 rollout을 읽고 규칙을 추가·삭제·교체하되, held-out validation 점수가 실제로 올랐을 때만 새 문서를 채택한다.
Semantic Tube Prediction(STP)은 한 token sequence 안에서 앞·뒤 hidden-state의 이동 방향을 맞추는 학습법이다. 별도의 target encoder나 두 view 없이 기존 forward의 hidden state를 재사용한다.
LLM-JEPA는 Transformer를 새로 설계하지 않는다. 기존 Next Token Prediction(NTP)에, 같은 의미를 가진 두 표현의 hidden representation을 맞추는 보조 loss를 더한다.
Sakana Fugu는 일본산 단일 프론티어 LLM이 아니다. 하나의 모델처럼 호출하지만 내부에서는 여러 모델에 역할을 나누고 결과를 검증·합성하는 learned orchestration system이다.
멀티모달 모델은 이미지를 보고 답할 수 있지만, 작은 글자나 복잡한 그래프를 한 번에 정확히 읽지는 못한다. 한눈에 보이지 않는 부분을 확률적으로 메우면 그럴듯한 오답이 생긴다.