오늘의 핵심
- 오픈AI 와 앤트로픽이 같은 날 새 주력 모델을 내놨습니다. GPT-6 Sol 은 값을 절반으로 내렸고 Claude Opus 5.5 는 캐시 읽기를 60% 내려, 경쟁축이 성능에서 반복 작업 비용으로 옮겨 가는 모습입니다.
- 에포크 AI 가 주요 벤치마크 15개 가운데 9개에 결함이 있다고 판정했습니다. 채점표 오류와 버전 간 비교 불가가 확인돼, 공개 점수만으로 모델을 고르기가 어려워졌습니다.
- AI 가 써 준 문서와 코드를 두고 반론 두 편이 같은 날 상위권에 올랐습니다. 맥락이 빠진 글은 읽는 부담을 떠넘기고, 즉각 보상으로 배우는 구조는 몇 년 뒤 드러나는 유지보수 비용을 배울 수 없다는 지적입니다.
AI 모델 동향
오픈AI, GPT-6 Sol·Luna 공개
AI타임스
오픈AI가 9월 22일 새 주력 모델 GPT-6 Sol 과 경량 모델 Luna 를 내놨습니다. 100만 토큰당 가격은 Sol 이 입력 $2·출력 $10, Luna 가 입력 $0.10·출력 $0.50 으로 GPT-5.6 대비 절반입니다. 사람 직무를 흉내 낸 과제로 재는 GDPval-AA v2.1 에서 Sol 은 49% 로 같은 날 나온 Opus 5.5(67%)에 못 미쳤고, 오픈AI 는 캐싱과 추론 효율을 올려 재사용 토큰에 90% 할인을 붙였다고 밝혔습니다. 값싼 쪽을 고르는 기준이 성능표에서 캐시 적중률로 옮겨 갑니다.
앤트로픽, Claude Opus 5.5 공개
Anthropic
앤트로픽이 같은 날 Claude Opus 5.5 를 공개했습니다. 명령줄 작업을 끝까지 해내는지 보는 터미널벤치 4.0 에서 66.4%(Opus 5 는 52.3%), 컴퓨터를 직접 조작하는 OSWorld 2.0 에서 81.8% 를 냈습니다. 가격은 100만 토큰당 입력 $4·출력 $20 으로 20% 내렸고 캐시 읽기는 60% 내린 $0.20 입니다. 회사는 68만 줄 코드 이전을 하루에 끝냈다고 밝혔으나 외부에서 확인된 값은 아닙니다. Sonnet·Haiku 5.5 도 수 주 안에 나옵니다.
에포크 AI, 주요 벤치마크 15개 중 9개를 '결함' 으로 판정
AI타임스
에포크 AI 가 널리 쓰이는 벤치마크 15개를 뜯어보고 9개를 '결함' 으로 판정했습니다. 정답표가 문제 설명과 어긋나거나, 도구를 제대로 쓴 답을 틀렸다고 채점하는 사례가 나왔고, 버전이 바뀌면 이전 결과와 비교가 안 되는 문제도 있었습니다. 문항의 20% 이상에서 점수에 영향을 주는 오류가 있으면 결함으로 분류했습니다. 모델을 고를 때 공개 점수만 보고 판단하기 어려워졌다는 뜻입니다.
알리바바, 큐원4 학습 중·자체 칩 전우 V900 공개
ZDNet 코리아
알리바바가 압사라 컨퍼런스에서 다음 모델 큐원4 를 학습 중이라고 밝히고, 이후 큐원4.5·큐원5 로 이어 매개변수를 5조~10조까지 늘리겠다고 했습니다. 함께 공개한 자체 칩 전우 V900 은 메모리 216GB, 칩 사이 대역폭 초당 1200GB 로 앞선 M890 대비 3배 성능을 내세우며 내년 1분기 출시 예정입니다. 데이터센터는 2032년까지 20GW 이상으로 늘립니다. 중국 쪽 오픈 모델의 다음 세대가 자체 칩 위에서 나온다는 신호입니다.
메타 에이전트 '뮤즈', 초기 사용자 수에서 챗GPT 앞질러
AI타임스
메타가 내놓은 개인 비서 에이전트 '뮤즈' 가 초기 사용자 수에서 챗GPT 를 앞섰습니다. 웹 검색·메일 정리·일정 관리·양식 작성을 대신하고 지메일·캘린더·오픈테이블 같은 바깥 서비스와도 연결됩니다. 앱토피아 집계로 출시 13일간 내려받기 180만 건(챗GPT 130만 건), 미국 하루 사용자 64만 2000명(챗GPT 23만 1000명)입니다. 구독은 월 20달러와 100달러 두 갈래입니다. 초기 수치라 유지율은 아직 알 수 없습니다.
코딩 에이전트
코덱스 개발 이야기: 에이전트 핵심부를 Rust 로
GeekNews
오픈AI 코덱스를 만든 사람이 개발 과정을 공개했습니다. 사내 연구를 빠르게 하려고 만든 도구에서 출발했고, 에이전트의 핵심부를 정확성·보안·효율 때문에 Rust 로 구현해 제품 화면과 분리했으며 그 하네스(모델을 감싸 도구를 쥐여 주는 껍데기)를 오픈소스로 열었습니다. 모델과 하네스를 같이 설계해 모델이 좋아지면 보완 코드를 덜어 내는 방식을 씁니다. 로컬 샌드박스와 관리형 클라우드 VM 을 같은 구조로 돌립니다.
Agent Substrate: 에이전트 격리 실행을 10배 밀도로
GitHub 트렌딩
에이전트를 격리해 돌리는 런타임 Agent Substrate 가 공개돼 하루 만에 별 300개가 붙었습니다. 쉬고 있는 에이전트를 공용 작업자 풀에 겹쳐 얹어 일반 컨테이너 대비 10배 밀도를 내고, 멈췄다 다시 켜는 데 500ms 미만이 걸린다고 밝힙니다. 쿠버네티스 위에서 microVM·gVisor 같은 여러 격리 방식을 골라 쓸 수 있습니다. 다만 초기 단계라 API 호환성을 보장하지 않는다고 스스로 적어 두었습니다.
Univer: 표·문서·슬라이드를 에이전트가 다루는 런타임
GitHub 트렌딩
표·문서·슬라이드를 앱 안에 심는 오픈소스 SDK 유니버가 에이전트용 런타임을 내세우며 하루에 별 200개를 더했습니다. 캔버스 렌더러와 자체 수식 엔진을 갖고 브라우저와 Node.js 양쪽에서 같은 코드로 돕니다. 에이전트 쪽으로는 문서를 코드로 읽고 고치는 API, 화면 캡처와 배치 분석으로 결과를 확인하는 경로, 사람이 검토하도록 초안을 따로 두는 협업 모드를 제공합니다. 라이선스는 아파치 2.0 입니다.
추론·인프라
엔비디아 Topograph: 클러스터 연결 구조를 스케줄러에 알려 주기
NVIDIA 개발자 블로그
엔비디아가 GPU 클러스터의 연결 구조를 스케줄러에 알려 주는 오픈소스 도구 Topograph 를 공개했습니다. 어떤 GPU 가 어떤 스위치·NVLink 로 묶여 있는지 찾아내 쿠버네티스 라벨이나 Slurm 설정으로 내보내면, 스케줄러가 작업을 가까운 GPU 끼리 모아 배치합니다. 멀리 떨어진 노드에 흩어지면 공용 링크로 통신이 몰려 처리량이 떨어지기 때문입니다. 클러스터 구성이 자주 바뀌는 곳에서 쓸 만합니다.
로컬·하드웨어
M5 Ultra 맥 스튜디오로 로컬 에이전트를 상시 돌려 본 기록
GeekNews
맥스토리즈가 M5 Ultra 맥 스튜디오로 로컬 에이전트를 상시 돌려 본 기록을 올렸습니다. 메모리 대역폭이 819GB/s 에서 1.2TB/s 로 늘어 M3 Ultra 대비 생성 속도 약 70%, 프롬프트 처리 약 150% 빨라졌다고 적습니다. 통합 메모리 256GB 로 큰 모델을 통째로 올려 99일간 API 비용 0달러로 문서 310건을 정리했습니다. 다만 프롬프트 처리 속도는 RTX 5090 의 절반 수준이고 장비값이 1만 5000달러대입니다.
AMD 라이젠이 2년 만에 50% 빨라진 이유
Hacker News
다니엘 르미어가 라이젠 7 세 세대(5800X3D·7800X3D·9800X3D)의 긱벤치 6 점수를 놓고 2년 사이 무엇이 달라졌는지 따져 봤습니다. 단일 코어 47%·전 코어 58% 빨라졌는데 클록은 4.5GHz 에서 5.2GHz 로 15% 오르는 데 그쳤습니다. 차이는 구조에서 나왔습니다. 트랜지스터가 110억 개에서 160억 개로 늘고, 한 주기에 내보내는 명령이 6개에서 8개로, 코어당 L2 캐시가 512KB 에서 1MB 로 늘었습니다.
시스템 프로그래밍
FoxDev Studio: 비주얼 폭스프로를 Rust·WebAssembly 로 되살리다
Hacker News
2007년에 개발이 끊긴 비주얼 폭스프로 9 프로그램을 고치지 않고 그대로 돌리는 개발 환경 FoxDev Studio 가 공개됐습니다. 원래의 32비트 해석기를 버리고 Rust 로 쓴 WebAssembly 가상 머신과 자체 바이트코드 컴파일러를 얹어 64비트로 옮겼고, 표 하나가 2GB 를 넘을 수 있게 됐습니다. 원본 언어 요소 1,534개를 대조 검증했다고 밝힙니다. 아직 돌아가는 옛 업무 시스템이 남은 곳에는 이전 비용을 줄이는 길입니다.
클라우드플레어 Python Workers 정식 출시
Cloudflare 블로그
클라우드플레어가 파이썬을 Workers 의 정식 언어로 올렸습니다. FastAPI·Django·Flask 앱을 서버 없이 올릴 수 있고 R2·D1·Durable Objects 같은 자사 서비스와 Hyperdrive 를 통한 PostgreSQL·MySQL 연결도 됩니다. 브라우저에서 파이썬을 돌리는 Pyodide 를 바탕으로 WebAssembly 위에서 실행하며, TCP 소켓을 구현해 데이터베이스 드라이버까지 붙였습니다. 다만 커뮤니티에서는 900ms 안팎의 콜드 스타트가 지적됐습니다.
보안
SAML: 나쁜 설계의 프랙탈
Trail of Bits
보안 감사 회사 트레일오브비츠가 기업 싱글사인온의 바탕인 SAML 을 더는 쓰지 말자고 주장했습니다. XML 자체의 복잡함, 같은 문서를 양쪽이 똑같은 바이트로 만들기 어려운 정규화 문제, 서명을 서명 대상 안에 넣는 구조를 치명적 결함 다섯 가지로 꼽습니다. 2018년 XML 주석 우회, 2025년 깃허브 엔터프라이즈 우회처럼 실제로 인증을 통과한 사례도 이어졌습니다. 대안으로는 OpenID Connect 를 권합니다.
개발 문화
당신이 직접 쓰지 않은 글은 읽고 싶지 않다
GeekNews
콜린 브렉이 AI 가 써 준 설계 문서와 PR 요약은 읽고 싶지 않다고 적었습니다. 바뀐 것은 빠짐없이 나열하지만 왜 필요한지, 어디를 눈여겨봐야 하는지가 빠져 있어, 배경을 모르는 읽는 사람이 모든 문장을 똑같은 무게로 확인해야 한다는 것입니다. 결과를 먼저 만들고 문서를 나중에 붙이면 생각을 다듬고 동료 의견을 받는 과정도 사라집니다. 검증·교정·사실 확인에 쓰는 것은 다른 이야기라고 덧붙입니다.
AI 에게는 지혜가 없고 당신에게도 없게 될 것이다
alexn.org
스칼라 라이브러리를 만들어 온 알렉산드루 네델추가 AI 에 기대면 숙련에 이르지 못한다고 적었습니다. 유지보수의 문제는 몇 달에서 몇 년 뒤에 드러나는데 즉각적인 보상으로 학습하는 구조에서는 그 신호를 배울 수 없다는 것이 논지입니다. 사람 쪽도 고르지 않고 실수를 책임지지 않으면 판단이 쌓이지 않는다고 봅니다. 앞으로 'AI 안 씀' 을 경쟁력으로 내거는 회사가 늘 것이라 예측합니다.
깊이 읽을거리
확산 언어 모델을 만드는 방법
Kuleshov Group
글을 왼쪽부터 한 단어씩 만드는 지금 방식 대신, 빈칸이 뚫린 문장을 여러 자리에서 동시에 채워 가는 확산 언어 모델을 처음부터 설명하는 글입니다. 문장 일부를 가리고 복원하도록 학습시키는 방법에서 시작해 블록 단위 생성, 이미 쓴 토큰을 다시 고치기, 생성 단계를 줄이는 증류까지 차례로 쌓아 올립니다.
실물도 함께 짚습니다. Mercury 는 일반 GPU 에서 초당 1,000토큰 이상을 내고, 구글 Gemma Diffusion 과 엔비디아 Nemotron Diffusion 이 나왔으며 단백질(ESM3)·DNA(NT-v3) 설계에도 쓰입니다.
왜 읽을 만한가속도를 올리는 요령이 아니라 생성 순서를 바꾸면 무엇이 가능해지는지를 다룹니다. 병렬 생성이 후속 학습과 추론에 쓸 연산을 키우는 길이 될지가 남은 질문으로 제시되어, 요즘 쏟아지는 확산 모델 소식을 읽을 기준이 생깁니다.
곁가지
AI 가 무너뜨리는 공유의 문화
GeekNews
체스터 위스니에프스키가 35년간 쌓인 오픈소스 공유 문화가 무너지고 있다고 적습니다. 라이선스를 무시한 학습 데이터 수집, 저품질 AI 산출물과 악성 라이브러리가 섞이며 떨어진 신뢰, 봇이 보내는 쓸모없는 기여를 검토해야 하는 부담을 이유로 듭니다.
오픈AI, 수학계 반발에 독립 자문 기구 신설
AI타임스
오픈AI 가 프린스턴 고등연구소에 수학·AI 자문 그룹을 만들었습니다. 미해결 문제 100여 개를 풀었다는 발표 뒤 필즈상 수상자 25명을 포함한 수학자들이 공개서한으로 반발한 데 따른 것입니다. 성과의 중요성 평가와 공개 시기 조율을 맡되 연구 속도를 조절할 권한은 없습니다.