SkillOpt-Sleep 실제 평가 - 점수는 올랐지만 스킬은 좋아지지 않았다
SkillOpt-Sleep을 실제 코딩 에이전트의 작업형 skill에 연결해 전체 사이클을 돌려봤다. 세션 수집부터 후보 규칙 생성, held-out gate, staging과 수동 적용까지 pipeline은 정상 작동했다.
SkillOpt-Sleep을 실제 코딩 에이전트의 작업형 skill에 연결해 전체 사이클을 돌려봤다. 세션 수집부터 후보 규칙 생성, held-out gate, staging과 수동 적용까지 pipeline은 정상 작동했다.
SkillOpt를 설치하면 두 가지 경로를 선택할 수 있다. 연구용 trainer는 benchmark를 준비해 skill 문서 전체를 훈련하고, SkillOpt-Sleep은 코딩 에이전트의 과거 세션에서 작은 개선 규칙을 제안한다.
Sakana Fugu는 일본산 단일 프론티어 LLM이 아니다. 하나의 모델처럼 호출하지만 내부에서는 여러 모델에 역할을 나누고 결과를 검증·합성하는 learned orchestration system이다.
멀티모달 모델은 이미지를 보고 답할 수 있지만, 작은 글자나 복잡한 그래프를 한 번에 정확히 읽지는 못한다. 한눈에 보이지 않는 부분을 확률적으로 메우면 그럴듯한 오답이 생긴다.
로컬 모델이 코드를 잘 생성하는지와 coding agent로 저장소를 안전하게 다루는지는 다른 문제다. OpenCode에 LM Studio provider를 고정하고 모델만 바꿔, 파일 탐색과 근거 해석이 필요한 같은 과제를 반복했다.
Ollama는 로컬 모델을 Codex App의 provider로 연결하는 명령을 제공한다. 앱 화면은 그대로 사용하면서 실제 응답은 로컬 모델이 만든다.
OpenCode와 Oh My OpenAgent(OMO)를 함께 소개하는 글을 보면 둘의 경계가 흐리게 느껴진다. OpenCode는 모델이 파일과 터미널 도구를 사용하는 코딩 에이전트 런타임이고, OMO는 그 위에 역할 분담과 작업 루프를 얹는 플러그인형 오케스트레이션 레이어다.
로컬 LLM은 같은 모델도 BF16, Q8, Q4에 따라 필요한 메모리와 품질이 크게 달라진다. 4비트로 줄이면 실행 가능한 모델의 체급이 올라가지만, 압축 과정에서 다음 토큰 확률분포가 흔들릴 수 있다.
llama.cpp는 GGUF 모델을 직접 실행하는 로컬 추론 런타임이다. Ollama처럼 모델 관리를 감싸기보다 모델 파일, quantization, context, sampling, 서버 포트를 명령으로 직접 제어한다.
LM Studio는 로컬 LLM을 검색하고 내려받아 실행하는 데스크톱 앱이다. 모델 파일과 quantization을 GUI에서 고를 수 있고, 내려받은 모델을 OpenAI 호환 API 서버로 띄울 수도 있다.
Ollama, LM Studio, llama.cpp는 모두 로컬 모델을 실행하고 OpenAI 호환 API로 노출할 수 있다. 같은 GGUF 계열 모델을 띄울 수 있어도 사용 목적과 제어 범위는 꽤 다르다.
Ollama는 로컬 LLM을 내려받고 실행하며, 다른 앱이 사용할 수 있는 API 서버까지 함께 제공한다. 모델 파일과 실행 옵션을 직접 다루는 llama.cpp보다 시작이 쉽고, GUI 중심인 LM Studio보다 터미널 자동화에 잘 맞는다.
OpenAI가 ChatGPT Images 2.0(모델 ID gpt-image-2)을 공개했다. 이미지 생성의 약점이던 텍스트·다국어·일관성을 크게 끌어올리고, 대화형 편집과 프롬프트 재작성까지 하나의 흐름으로 묶은 OpenAI의 새 이미지 생성 모델이다.
Anthropic이 Claude Opus 4.7을 공개했다. 답변 품질을 조금 올린 챗봇 업데이트가 아니라, 코딩 에이전트, 장기 업무 위임, 고해상도 비전, 엄격한 지시 이행을 축으로 개선된 Anthropic의 최상위 공개 모델이다.
로컬 LLM을 써보려 하면 가장 먼저 부딪히는 문제는 “어떤 모델이 제일 좋나?”보다 “내 맥에서 어떤 모델이 현실적으로 돌아가나?”다. llmfit는 이 질문에 먼저 답해주는 도구다. 모델을 직접 실행하는 프로그램은 아니지만, 내 하드웨어에 맞는 후보를 먼저 좁혀준다는 점에서 로...
AI가 손쉽게 브라우저를 조작할 수 있도록 만들어주는 Playwright를 사용해보자. GPT 5.4에서 playwright-interactive 스킬 기반으로 웹 앱/게임을 만들었다고 하는데, 이 Playwright가 뭘까?
OpenAI가 GPT 5.4를 출시했다. Tool Calling, Computer Use 등 Agent 성능이 크게 향상되었으며, 주요 벤치마크에서 타 모델들을 확연히 이기며 명실상부한 SOTA에 등극했다.
2월에 Google은 Gemini의 창작 기능을 음악과 이미지 양쪽으로 대폭 확장했다. Lyria 3로 음악 생성을, Nano Banana 2로 이미지 생성을 한 단계 끌어올렸고, 관련 내용을 이 글로 통합 정리했다.
2월 23일, Anthropic이 공식 블로그를 통해 중국 AI 연구소 3곳의 대규모 증류 공격 정황을 공개했다.
2월 한 달간 AI 업계에서는 주요 기업들이 동시다발적으로 새 모델을 쏟아냈다. Opus 4.6의 SOTA 달성으로 시작해 Gemini 3.1 Pro의 SOTA 탈환으로 마무리된 한 달을 출시 순서대로 정리해본다.