QAT 양자화란 무엇인가 - 4비트 로컬 LLM의 품질 손실을 줄이는 방법
로컬 LLM은 같은 모델도 BF16, Q8, Q4에 따라 필요한 메모리와 품질이 크게 달라진다. 4비트로 줄이면 실행 가능한 모델의 체급이 올라가지만, 압축 과정에서 다음 토큰 확률분포가 흔들릴 수 있다.
로컬 LLM은 같은 모델도 BF16, Q8, Q4에 따라 필요한 메모리와 품질이 크게 달라진다. 4비트로 줄이면 실행 가능한 모델의 체급이 올라가지만, 압축 과정에서 다음 토큰 확률분포가 흔들릴 수 있다.
llama.cpp는 GGUF 모델을 직접 실행하는 로컬 추론 런타임이다. Ollama처럼 모델 관리를 감싸기보다 모델 파일, quantization, context, sampling, 서버 포트를 명령으로 직접 제어한다.
LM Studio는 로컬 LLM을 검색하고 내려받아 실행하는 데스크톱 앱이다. 모델 파일과 quantization을 GUI에서 고를 수 있고, 내려받은 모델을 OpenAI 호환 API 서버로 띄울 수도 있다.
Ollama, LM Studio, llama.cpp는 모두 로컬 모델을 실행하고 OpenAI 호환 API로 노출할 수 있다. 같은 GGUF 계열 모델을 띄울 수 있어도 사용 목적과 제어 범위는 꽤 다르다.
Ollama는 로컬 LLM을 내려받고 실행하며, 다른 앱이 사용할 수 있는 API 서버까지 함께 제공한다. 모델 파일과 실행 옵션을 직접 다루는 llama.cpp보다 시작이 쉽고, GUI 중심인 LM Studio보다 터미널 자동화에 잘 맞는다.
Claude Code를 tmux 안에서 오래 실행하면 두 군데에서 자주 막힌다. 응답이 갱신될 때 화면이 아래로 튀고, macOS 클립보드의 이미지는 평소처럼 Cmd+V를 눌러도 첨부되지 않는다.
GitHub 저장소를 HTTPS로 clone한 뒤 git push에서 비밀번호를 요구받는다면 계정 비밀번호를 넣어도 인증되지 않는다. GitHub은 2021년 8월부터 Git 작업의 비밀번호 인증을 받지 않는다.
OpenAI가 ChatGPT Images 2.0(모델 ID gpt-image-2)을 공개했다. 이미지 생성의 약점이던 텍스트·다국어·일관성을 크게 끌어올리고, 대화형 편집과 프롬프트 재작성까지 하나의 흐름으로 묶은 OpenAI의 새 이미지 생성 모델이다.
Anthropic이 Claude Opus 4.7을 공개했다. 답변 품질을 조금 올린 챗봇 업데이트가 아니라, 코딩 에이전트, 장기 업무 위임, 고해상도 비전, 엄격한 지시 이행을 축으로 개선된 Anthropic의 최상위 공개 모델이다.
처음에는 나도 Obsidian용 기본 스킬 몇 개만 있으면 AI 비서가 금방 돌아갈 줄 알았다. markdown을 읽고, .base를 만지고, CLI로 앱까지 건드릴 수 있으니 얼핏 보면 충분해 보이기 때문이다. 그런데 며칠만 써 보면 금방 차이가 드러난다. 파일을 다룰 수 있는 ...
VS Code 위에서도 개인 비서용 환경을 만들 수는 있다. 문제는 일정 화면, 칸반 보드, 템플릿, 첨부 정리까지 붙이기 시작하면 다시 도구를 만드는 일로 돌아가기 쉽다는 점이다. 내가 Obsidian을 계속 쓰는 이유는 markdown 파일 기반이라서만이 아니라, 이미 잘 만들...
Obsidian 구조를 잘 만들어도 오래 가는 건 별개다. 시간이 지나면 AGENTS.md는 두꺼워지고, 장기 메모리와 임시 판단이 섞이고, 새 규칙이 생길 때마다 어디를 고쳐야 할지 헷갈리기 시작한다. 1편과 2편이 왜 이 시스템을 다시 시도하게 됐는지와 구조를 어떻게 나눴는지를...