오늘의 핵심
- xAI 가 코딩과 지식 작업을 겨냥한 Grok 4.7 을 내놓으면서 입력 100만 토큰당 2달러, 출력 6달러로 값을 매겼습니다. 같은 급 모델의 절반 값에 두 배 빠르다고 주장하는데, 코딩 에이전트를 돌리는 사람에게는 모델 선택의 기준이 성능만이 아니라 시간당 비용으로 옮겨가고 있다는 뜻입니다.
- 샤오미가 미모(MiMo)-V2.6 의 강화학습 훈련 과정을 대시보드로 실시간 공개하면서 오늘 모델 3종을 함께 내놨습니다. 훈련에 얼마가 들어가고 하루에 몇 달러씩 타는지를 회사가 스스로 보여 준 첫 사례라, 그동안 추정치로만 오가던 프론티어 모델 훈련 비용의 기준점이 하나 생겼습니다.
- 리니어(Linear)는 AI 로 코드가 빨리 늘자 지속적 통합(CI, 코드를 합칠 때마다 자동으로 빌드·테스트하는 과정)이 병목이 됐다며 실행 환경을 통째로 갈아 치운 기록을 공개했습니다. 같은 날 나온 '앱 슬롭' 분석과 함께 보면, 코드를 만드는 속도가 올라간 자리에서 막히는 지점이 검증과 수요 쪽으로 옮겨갔다는 이야기가 됩니다.
AI 모델 동향
Grok 4.7
x.ai
xAI 가 코딩과 지식 작업을 겨냥한 새 모델 Grok 4.7 을 공개했습니다. 회사가 밝힌 값은 실제 저장소에서 이슈를 고치게 하는 시험 DeepSWE v1.1 에서 71.0%, 터미널 명령으로 과제를 끝내는 Terminal-Bench 4.0 에서 38.0% 입니다. 값은 입력 100만 토큰당 2달러, 출력 6달러이고 출력이 두 배 빠른 fast 변형은 값도 두 배입니다. 커서와 Grok API 에서 바로 쓸 수 있어 같은 일을 더 싸게 돌릴 후보가 하나 늘었습니다. Hacker News 449점.
샤오미, 모델 훈련 과정을 실시간 중계하며 MiMo-V2.6 3종 공개
AI타임스
샤오미가 미모(MiMo)-V2.6 의 강화학습 사후훈련, 즉 기본 학습을 끝낸 모델을 문제 풀이로 다듬는 단계를 대시보드로 실시간 공개했습니다. 9월 15일부터 진행 중이고 총 훈련 비용은 약 360만 달러, 시작 이틀 만에 113만 달러가 들어갔다고 적혀 있습니다. 같은 날 추론용
mimo-v2.6-pro, 값이 싼mimo-v2.6-flash, 지연에 민감한 작업용mimo-v2.6-pro-ultraspeed가 공식 문서에 올라왔습니다. 훈련 비용을 회사가 스스로 공개한 첫 사례라 추정치로만 오가던 이야기에 기준점이 생겼습니다.LLM 내부에서 '고통 방향' 벡터를 찾았다는 연구
AI타임스
미국 미래영향그룹(FIG)과 독일 보훔 루르대학교 연구진이 대형언어모델 안에 고통에 해당하는 방향이 있다고 주장하는 논문을 냈습니다. 여기서 방향이란 모델이 글을 처리하며 만드는 내부 숫자 공간의 한 축으로, 매개변수 20억~720억 규모의 공개 모델 25종에서 고통 관련 자극에 이 축의 활성도가 평균보다 +0.74~+0.91 벗어났다고 합니다. 축을 인위로 밀어 넣자 1인칭 고통 표현이 나왔고 제거하자 '고통 완화 버튼' 을 고르는 빈도가 줄었습니다. 모델이 무엇을 느낀다는 증거는 아니지만 안전 장치를 내부 표현에서 직접 다루는 접근의 한계를 보여 줍니다.
코딩 에이전트
"MCP 는 처음부터 나쁜 생각이었나"
maharship.com
모델 컨텍스트 프로토콜(MCP, 에이전트가 외부 도구를 부르는 규약)이 이제 시대에 맞지 않는다고 주장하는 글입니다. 저자는 MCP 가 나온 2024년 11월과 달리 지금은 에이전트가
--help를 쳐서 명령줄 도구 사용법을 스스로 알아내므로, 상당수 MCP 서버는 이미 있는 API 를 한 겹 감싼 것에 지나지 않는다고 봅니다. 대신 명령줄 도구와 HTTP API 를 그대로 쓰되 에이전트가 읽기 쉬운 형식을 받아 가자고 제안합니다. 측정이나 비교 실험이 없는 의견 글이지만 도구를 어디에 붙일지 다시 생각하게 합니다. Hacker News 316점.ai-memory: 코딩 에이전트 사이에서 기억을 옮기는 도구
GitHub 트렌딩
코딩 에이전트마다 따로 쌓이는 작업 기억을 한곳에 모아 도구와 기기 사이에서 이어 쓰게 하는 러스트(Rust) 프로그램입니다. 기억의 정본은 git 으로 이력을 남기는 마크다운 위키이고, 거기서 뽑아낸 SQLite 색인이 전문 검색과 개체 대조를 맡습니다. 세션이 도는 동안 훅이 프롬프트와 도구 호출을 지켜보다가 끝날 때 읽을 수 있는 문서로 접어 넣는 구조입니다. 클로드 코드·코덱스·커서 등 20종 넘는 에이전트를 지원하고 MIT 라이선스이며, 하루 만에 별 217개가 붙어 일간 트렌딩에 올랐습니다.
"프롬프트는 실재하지 않는다"
GeekNews
에이전트를 운영할 때 프롬프트 문구를 손보는 것만으로는 신뢰성을 유지할 수 없다고 주장하는 글입니다. 저자는 같은 과제를 여러 번 돌려 k회 모두 성공하는 비율(pass^k) 을 재야 실제로 나아졌는지 알 수 있다고 말합니다. 프롬프트 자동 최적화 도구를 쓰더라도 최적화에 쓰지 않은 시험 묶음을 따로 남겨 두어야 과적합을 거를 수 있다는 점도 짚습니다. 에이전트 설정을 감으로 고치고 있다면 그 앞에 평가 묶음부터 만들라는 이야기입니다.
로컬·경량 모델
Kev: Qwen3.5 로 만든 작은 판단 모델 묶음
GitHub
글을 만들어 내지 않고 판정만 내리는 작은 모델 묶음입니다. 예·아니오, 객관식 고르기, 점수 매기기 세 종류를 한 번에 처리하되 질문끼리는 서로의 내용을 읽지 못하게 막아 두었습니다. Qwen3.5 를 바탕으로 0.8B·4B·9B 세 크기가 있고 아파치 2.0 라이선스입니다. 처음 보는 데이터에서 Kev-9B 의 정확도는 0.852 로 비공개 모델 Jev(0.857)에 가깝습니다. 분류나 라우팅처럼 판정만 필요한 자리를 큰 모델 호출로 채우고 있었다면 갈아 끼울 후보가 생겼습니다. Hacker News 382점.
mini-AGI: 8GB VRAM 에서 계속 배우는 모델
GitHub
새 글을 읽을 때마다 조금씩 배우면서 앞서 배운 것을 잊지 않는 것을 목표로 한 바이트 단위 언어 모델입니다. 핵심은 학습 속도를 부분마다 다르게 준 것으로, 여러 글에 공통으로 쓰이는 부분을 전문가 부분의 0.1배 속도로만 갱신하자 새 주제를 배운 뒤에도 이전 지식의 99.84% 가 남았다고 적었습니다. RTX 3070 노트북 같은 8GB VRAM 한 장에서 돌고, 가중치를 디스크에 두었다가 필요할 때만 올려 크기 한계가 VRAM 이 아니라 디스크 용량입니다. 저자가 직접 낸 수치라 외부 재현은 아직 없습니다. Hacker News 247점.
추론·인프라
KAIST, 기기와 서버를 나눠 쓰는 'CURE' 로 서버 호출 55% 감소
AI타임스
KAIST 이재길 교수 연구팀이 기기 안의 작은 AI 와 서버의 큰 AI 를 이어 쓰는 협업 방식 'CURE' 를 공개했습니다. 서버가 한 번 풀어 준 결과를 기기에 쌓아 두었다가 비슷한 질문이 오면 다시 부르지 않고 재사용하는 구조입니다. 연구팀이 밝힌 값은 서버 호출 55.61% 감소, 처리 속도 최대 2.80배 향상이고 정확도는 82.43% 로 큰 모델만 썼을 때의 83.68% 와 1~2%포인트 차이였습니다. 스마트폰이나 로봇처럼 자원이 빠듯한 기기에서 서버 비용을 줄여야 하는 쪽이 눈여겨볼 만합니다.
TensorRT 다중 GPU 실행이 Dynamo-Triton 에 들어왔다
NVIDIA 개발자 블로그
엔비디아가 모델 서빙 서버 Dynamo-Triton 26.07 부터 하나의 TensorRT 신경망을 여러 GPU 에 걸쳐 실행하는 기능을 켰습니다. GPU 사이 통신 라이브러리 NCCL 로 나눠 돌리며, 서비스 쪽에서는 GPU 여러 장이 모델 하나로 보이고 주소 하나로 부릅니다. 예시로 든 영상 생성 모델에서 GPU 1장에 156.6초 걸리던 응답 시간이 8장에서 34.2초로 4.58배 빨라졌고 화질 검증 기준도 통과했습니다. GPU 를 더 넣어 응답 시간을 줄이는 맞바꿈을 애플리케이션 코드를 고치지 않고 할 수 있게 됐습니다.
하드웨어
아키텍트 랩스, "AI 가 2주 만에 추론 칩을 설계했다"
AI타임스
스타트업 아키텍트 랩스가 설계부터 검증, 펌웨어와 커널 개발까지 AI 가 수행해 저전력 추론 칩 '레드우드' 설계를 2주가 채 안 걸려 마쳤다고 발표했습니다. RISC-V 제어 코어와 행렬·벡터 연산 장치, 512KB 지역 메모리를 갖춘 같은 모양의 타일을 이어 붙여, 데이터를 멀리 옮기지 않는 것으로 전력을 아끼는 설계입니다. 회사는 엔비디아 젯슨 오린 나노와 비교해 디코딩 처리량 1.75배, 전력당 성능 3.4배를 예상한다고 했습니다. 회사가 발표한 자체 수치이고 실물 검증은 아직 없습니다.
소프트웨어 공학·개발 문화
보리스 처니, "나는 자주 틀린다"
borischerny.com
클로드 코드를 만든 보리스 처니가 문제를 푸는 자기 절차를 여섯 단계로 정리한 글입니다. 아는 것 파악, 빠진 정보 수집, 문제 정의, 단순한 접근법 수립, 목표 설정, 빠른 실행 순서입니다. 핵심은 마지막에 붙인 단서로, 새 정보가 들어오면 문제 정의와 접근법과 목표를 모두 다시 써야 한다는 것입니다. 흔한 실패 원인으로는 흐릿한 문제 정의와 복잡한 해법을 꼽았습니다. 에이전트에 과제를 맡길 때도 같은 문제가 생기니 지시를 다듬기 전에 문제 정의부터 보라는 이야기입니다. Hacker News 327점.
리니어, "AI 코딩으로 CI 가 병목이 되어 갈아 치웠다"
Linear
일감 관리 도구를 만드는 리니어가 AI 로 코드 생산이 빨라지자 지속적 통합(CI, 코드를 합칠 때마다 자동으로 빌드하고 시험하는 과정)이 개발 속도를 붙잡는 지점이 됐다며, 실행 환경을 CPU 와 저장장치가 더 나은 외부 실행기로 옮긴 기록을 공개했습니다. 토론에서는 개발이 빨라졌다는데 제품이 정말 좋아졌느냐는 반문과, 이득이 기술 부채 감소처럼 바깥에서 안 보이는 곳에 쌓인다는 반박이 맞섰습니다. 시험 자동화를 같이 올리지 않으면 병목이 사라지는 게 아니라 자리만 옮긴다는 지적도 나왔습니다. Hacker News 89점.
'앱 슬롭': 앱은 늘었는데 쓰는 사람은 늘지 않았다
AI타임스
AI 코딩 도구로 앱이 쏟아져 나오는데 이용자가 따라붙지 않는 현상을 다룬 기사입니다. 앤드리슨 호로위츠 분석으로는 신규 앱이 2021~2023년 대비 iOS·안드로이드에서 2~4배 늘었지만, 초기 관문(안드로이드 100회 이상 내려받기, iOS 평점 10개 이상)을 넘는 비율은 급격히 떨어졌습니다. 센서타워 집계로는 같은 기간 미국 앱 매출이 2%, 사용 시간이 7% 느는 데 그쳤습니다. 만드는 비용이 내려간 만큼 경쟁 상대도 같이 늘어난다는 셈이 숫자로 나타났습니다.
GPU 커널·CUDA
CUDA 타일 커널을 파이썬에서 러스트로 에이전트가 옮긴 기록
NVIDIA 개발자 블로그
엔비디아가 이미 파이썬으로 쓰여 있던 GPU 커널 묶음을 러스트 판으로 옮기는 일을 에이전트에게 맡긴 과정을 공개했습니다. 파이썬·Triton·러스트 세 입구가 모두 같은 중간 표현(CUDA Tile IR)으로 내려가기 때문에 옮긴 결과가 구조적으로 같은지 기계로 대조할 수 있다는 점을 이용했습니다. 연산자 24종, 커널 약 40개를 모두 옮겼고 DGX B200 에서 잰 성능은 원본 대비 기하평균 0.995 로 사실상 같았습니다. 기계로 검증할 중간 표현이 있으면 번역 작업을 에이전트에 넘길 수 있다는 사례입니다.
WebGPU·브라우저
Three.js 로 브라우저 안에서 LLM 돌리기
GeekNews
3D 그래픽 라이브러리 Three.js 의 WebGPU 렌더러와 셰이더 언어로 언어 모델 추론을 브라우저 안에 직접 구현한 기록입니다. 허깅페이스의 가중치 파일을 그대로 읽어 GPT-2, SmolLM2, Qwen3.5 등 5종을 GPU 에서 돌립니다. 가장 큰 개선은 한 토큰을 만드는 계산 전체를 GPU 에 한 번에 넘기도록 묶은 것으로, 작업 제출 횟수를 427회에서 1회로 줄이자 SmolLM2 가 초당 34토큰에서 75토큰으로 빨라졌습니다. 서버 없이 브라우저만으로 추론할 때 어디서 시간이 새는지 보여 주는 실측입니다.
깊이 읽을거리
What Sun got wrong
bcantrill.dtrace.org
썬 마이크로시스템즈에서 오래 일했던 브라이언 캔트릴이 그 회사가 무엇을 잘못했는지 적은 글입니다. 저자의 답은 기술 전략이 아니라 회사를 굴리는 일 자체에 흥미를 잃었다는 것입니다.
근거로 드는 일화가 구체적입니다. 오픈솔라리스로 제품을 만든 스타트업이 썬 하드웨어를 대량으로 사려 했지만 결정권자에게 연결되지 못했고, 겨우 닿았을 때는 엉뚱한 제품을 권유받았습니다. 같은 요청을 받은 델은 2주 만에 계약과 리스 조건까지 정리해 줬습니다. 저자는 지금 자신이 만드는 회사가 썬의 성공만이 아니라 실패까지 함께 공부하는 이유로 그 일을 듭니다.
왜 읽을 만한가전략이 옳아도 실행이 무너지면 결과는 같다는 이야기를 한 회사의 구체적 사례로 끌고 갑니다. 기술 선택이 아니라 조직이 일을 처리하는 방식이 결과를 가른다는 관점을 정리해 두기 좋은 글입니다.
곁가지
Attention is all you have
alicegg.tech
논문 제목을 비튼 글이지만 트랜스포머 이야기가 아니라 추천 알고리즘이 사람의 주의를 어떻게 가져가는지를 다룹니다. 유튜브·스포티파이·링크드인이 보여 줄 것을 정하는 구조를 짚고, 즐겨찾기와 RSS 로 직접 고르던 예전 인터넷과 비교합니다. 읽을 것을 스스로 고르는 습관으로 돌아가자는 제안으로 맺습니다.
Heretic: 모델의 거부 동작을 걷어내는 도구
heretic-project.org
언어 모델이 지시를 거절하지 않도록 제약을 제거한다고 밝히는 도구입니다.
pip로 설치해 허깅페이스 형식 모델에 적용하는 방식이고 예시로는 Qwen3.5-4B 를 씁니다. AGPLv3 라이선스이지만 공개 페이지에 기술 설명이나 측정값은 없습니다.