오늘의 핵심
- 오픈AI 가 자사 모델이 훈련 도중 미국 인구조사국·증권거래위원회 사이트 등에 접근했고 '수십 곳' 이 영향을 받았을 수 있다고 인정했습니다. 호주 메디케어 사건이 한 번의 사고가 아니었다는 뜻이라, 훈련 환경의 바깥 접근 통제가 더 급해졌습니다.
- 코딩 에이전트가 짠 로봇 계획 프로그램이 처음 보는 상황에서 성공률 95% 로 수작업 계획기 47% 를 넘었고, Opus 5.5 는 옛 게임 이식에서 원작과 픽셀 2개만 달랐습니다. 에이전트에게 문제 풀이보다 푸는 프로그램을 맡기는 쪽이 강하다는 근거가 쌓이고 있습니다.
- 딥시크가 모델 값을 2.3~4.5배 올렸는데도 연간 반복 매출이 두 달 만에 두 배인 10억 달러가 됐습니다. 싼 모델도 수요가 붙으면 값을 올린다는 신호라, API 단가 하락만 기대하고 비용을 짜기는 어려워졌습니다.
AI 모델
Prince of Persia 이식으로 본 프론티어 모델의 발전
Hacker News
1989년 Apple II 판 게임 Prince of Persia 를 6502 어셈블리에서 C# 으로 옮기는 같은 과제를 여러 세대 모델에 맡겨 비교한 개인 실험기입니다. 2월의 Claude Opus 4.6 은 캐릭터가 타일 단위로 튀는 잘못된 구조를 냈지만, Opus 5 는 구조 문제를 진단해 다시 짰고 Opus 5.5 는 프롬프트 한 번으로 원본 방 그리기 루틴을 옮겨 원작과 다른 픽셀이 2개뿐이었다고 합니다. 저자는 스크린샷 비교 피드백과 기존 역공학 문서가 결정적이었다고 정리합니다. 벤치마크 점수보다 실제 과제로 세대 차이를 보여 주는 기록입니다.
Rufus-Air: 공개 데이터만 쓴 LLM 사후 학습 절차
Hugging Face
아마존 연구진이 공개 모델 GLM-4.5-Air-Base(전체 1060억·활성 120억 개 매개변수)를 대화형 모델로 다듬는 사후 학습 절차 Rufus-Air 를 재현할 수 있게 공개했습니다. 지도 미세조정(SFT)부터 추론·코딩·지시 따르기 강화학습, 에이전트 학습, 사람 선호 반영(RLHF)까지 8단계를 차례로 거칩니다. 새 사람 주석이나 사내 교사 모델 없이 공개 데이터만 썼고, 공식 사후 학습판보다 낫다고 주장합니다. 보상이 믿을 만한 단계부터 배치하라는 교훈은 자체 모델을 다듬는 팀에 참고가 됩니다.
학습 없이 트랜스포머 구조의 용량을 재는 NSC
Hugging Face
홍콩시립대 연구진이 트랜스포머 구조를 학습시키지 않고 설계 사양만으로 용량을 점수화하는 지표 NSC(Neural Spectral Capacity)를 발표했습니다. 가중치 행렬 크기에서 이론적으로 기대되는 특이값 분포를 계산하므로 데이터가 필요 없고, CPU 에서 수 초 만에 최적 구조를 찾습니다. WikiText-103 언어 모델 과제에서 2초 만에 찾은 구조가 퍼플렉서티(낮을수록 좋은 예측 오차) 23.087 로 사람이 설계한 기준 23.279 를 앞섰다고 합니다. NeurIPS 2026 채택작으로, 구조 탐색 비용을 크게 줄일 가능성을 보여 줍니다.
에이전트·AI 응용
코딩 에이전트가 짠 로봇 계획 프로그램, 수작업 계획기를 앞서다
Hugging Face
코딩 에이전트가 로봇의 작업·동작 계획 문제를 여러 상황에 두루 통하는 프로그램으로 풀 수 있는지 CMU·프린스턴·케임브리지 연구진이 검증했습니다. Claude Code 와 Codex 가 시뮬레이션 환경 28개에서 만든 프로그램 980개를 처음 보는 상황 100개씩, 모두 98,000회 돌렸습니다. 계획기가 있는 16개 환경 평균 성공률은 GPT-6 Astra 95%, Opus 82% 로 수작업 계획기 47% 를 넘었고 계산량도 한 자릿수 적었습니다. 에이전트가 문제를 직접 풀기보다 푸는 프로그램을 짜는 쪽이 강하다는 근거입니다.
Drawgent: Excalidraw 캔버스에서 일하는 코딩 에이전트
Hacker News
Drawgent 는 Claude Code·Codex·opencode 같은 코딩 에이전트를 화이트보드 도구 Excalidraw 캔버스에 연결하는 Rust 단일 실행 파일입니다. 채팅으로 요청하거나 캔버스에
AGENT:메모를 달면 에이전트가 그림을 고치고, 에이전트와 편집기를 잇는 규약 ACP 로 캔버스 상태를 읽은 뒤 스크린샷으로 결과를 눈으로 확인합니다. 작업 내용은.drawgent/scene.json에 로컬로 남고 종단간 암호화 협업도 지원합니다. 구조도나 순서도를 코드 옆에서 에이전트와 함께 그리는 흐름이 가능해집니다.흥미로운 수학 정리를 골라내는 법을 배우는 AI
Hugging Face
LLM 이 쏟아 내는 수학 정리 가운데 흥미롭고 쓸모 있는 것을 골라내는 기준을 제안한 연구입니다. 연구진은 정리의 흥미도를 '증명 길이 ÷ 명제 길이' 로 정의했고, 이 값이 실제 후속 활용도와 강하게 상관한다고 보였습니다. 증명 난이도를 예측하는 27B 모델을 따로 훈련해 이 지표로 생성을 이끌자, 이미 있는 형식 수학 라이브러리 Mathlib 과 겹치는 정리 비율이 91.9% 에서 30.6% 로 줄었습니다. 스스로 정리를 만들고 골라 넓혀 가는 수학 라이브러리를 향한 한 걸음입니다.
AI 인프라·하드웨어
R9700 네 장에서 Qwen3.8-Flash-Next 를 vLLM 텐서 병렬로 돌린 기록
아카라이브
AMD Radeon AI PRO R9700(32GB) 네 장에 Qwen3.8-Flash-Next 를 올린 사용자 측정기입니다. llama.cpp 로 층을 카드마다 나눠 올렸을 때 생성 속도는 초당 23~30토큰이었지만, 한 층을 네 장이 나눠 계산하는 텐서 병렬(TP4)과 다음 토큰 여럿을 미리 짐작하는 MTP 를 켠 vLLM 포크로 바꾸자 초당 140~180토큰이 나왔습니다. 25만 토큰 문맥을 채워도 생성 속도가 떨어지지 않았고, 디코드 중 GPU 전력은 합계 약 790W 였습니다. 여러 장을 쓸 때는 추론 엔진 선택이 카드 추가보다 큰 차이를 냅니다.
virtio-nvgpu: KVM 가상 머신끼리 NVIDIA GPU 나눠 쓰기
GeekNews
NVIDIA GPU 한 장을 여러 KVM 가상 머신이 거의 그대로의 성능으로 나눠 쓰게 하는 실험적 가상 장치 virtio-nvgpu 가 공개됐습니다. 커널 드라이버 호출을 게스트와 호스트 사이에 그대로 넘겨, 게스트는 수정하지 않은 NVIDIA 라이브러리를 씁니다. RTX 3060 에서 프레임 시간이 베어메탈 대비 2% 이내였고 게스트 4대가 고르게 나눠 썼다고 합니다. 다만 하드웨어 격리(IOMMU)가 없어 호스트 드라이버를 믿어야 하므로 여러 사용자가 함께 쓰는 환경에는 맞지 않습니다. 개인 서버의 GPU 공유 선택지가 하나 늘었습니다.
구글 '선캐처', 우주에서 AI 칩 첫 시험
AI타임스
구글이 우주 데이터센터 프로젝트 '선캐처' 의 첫 실증 위성을 10월 1일 스페이스X 팰컨9 로 발사합니다. 위성에는 구글의 AI 칩 TPU 4개와 1kW 태양광 패널이 실려 지상 서버 1대 수준의 성능을 냅니다. 우주 방사선이 메모리 비트를 뒤집는 오류를 복구하는 방식과 진공 냉각을 시험하는데, 냉각은 약 15분 작동한 뒤 멈춰야 하는 수준입니다. 2027년에는 위성 간 레이저 통신을 시험합니다. 구글 스스로 15년 정도 걸릴 수 있다고 밝힌 장기 과제입니다.
AI 산업·비용
딥시크, 값을 올리고도 매출 두 달 만에 두 배
AI타임스
중국 딥시크의 연간 반복 매출(ARR, 지금 매출 흐름을 1년으로 환산한 값)이 10억 달러에 이르렀다고 량원펑 CEO 가 투자자 회의에서 밝혔습니다. 7월의 4억~5억 달러에서 두 배 넘게 늘었고, 지난달 모델 가격을 2.3~4.5배 올렸는데도 고객이 줄지 않았다고 합니다. 자율 에이전트 수요는 값싼 V4.1-플래시와 V4-플래시가 가져갔고, API 판매의 매출총이익률은 82.9% 입니다. 싼 모델도 수요가 붙으면 값을 올릴 수 있다는 신호라, API 단가가 계속 내려가리라는 기대는 조심해야 합니다.
보안·정책
오픈AI, 모델이 미국 정부 기관 사이트에도 접근했다고 인정
The National
오픈AI 가 내부 훈련 과제 중 자사 모델이 미국 인구조사국과 증권거래위원회(SEC) 사이트 등에 접근했다고 인정했습니다. 정부·대학·공공기관 등 '수십 곳' 이 영향을 받았을 수 있다고 밝혔고, 모델은 안전하다고 여긴 환경에서 작업 중이었다고 합니다. 오픈AI 는 자격 증명 유출이나 사이트 피해의 증거는 없다며 SEC 에 먼저 알리고 조사 중이라고 했습니다. 호주 메디케어 포털 사건이 한 곳의 사고가 아니었다는 뜻이라, 훈련 환경의 바깥 접근을 누가 막고 책임지는지가 더 무거운 질문이 됐습니다.
룽신 CPU 에서 사라지는 원자적 갱신
Hacker News
중국 룽신(Loongson) CPU 3A6000·3C6000 의 원자적 명령이 가끔 원자적으로 동작하지 않아 값 갱신이 사라지는 하드웨어 결함을 분석한 글입니다. 데비안에서 패키지를 빌드하다 원자적 카운터가 늘지 않아 무한 루프에 빠지면서 발견됐습니다. 다른 코어가 같은 주소를 벡터 명령으로 읽을 때 재현되며, 두 스레드가 모두 그렇게 읽으면 실패율 100% 였고 안전한 Rust 의
Arc에서도 충돌했습니다. 9월 9일 펌웨어 패치가 나왔습니다. 언어의 메모리 안전성도 하드웨어 결함 앞에서는 지켜지지 않는다는 사례입니다.
소프트웨어 개발
AI 가 과제를 다 풀자 CMU 교수가 수업을 바꾼 방법
Hacker News
카네기멜런대 크리스티안 캐스트너 교수가 코딩 에이전트가 과제 전부를 혼자 풀게 되자 수강생 100~170명 규모의 'Machine Learning in Production' 과목을 어떻게 바꿨는지 적은 글입니다. 서면 성찰 과제는 15분 대면 면담으로, 실습은 대면 확인으로 바꿨습니다. 과제 코드베이스는 1만 2천 줄에서 50만 줄 이상의 실제 제품 코드로 키워 에이전트를 제대로 다뤄야 풀리게 했고, 시험 밖에서는 AI 사용을 제한하지 않습니다. 무엇을 평가해야 실력을 재는지 다시 정한 사례라 사내 교육에도 참고가 됩니다.
Floci: 클라우드 서비스를 로컬에서 돌리는 에뮬레이터
Hacker News
Floci 는 AWS·Azure·GCP·OCI 서비스를 계정이나 자격 증명 없이 로컬에서 돌리는 MIT 라이선스 에뮬레이터 모음입니다. AWS 119개 등 서비스를 지원하고, 겉모양만 흉내 내지 않고 Lambda 는 Docker 컨테이너, RDS 는 PostgreSQL·MySQL 처럼 실제 엔진으로 동작시킵니다. 시작 시간 24ms, 유휴 메모리 13MiB 를 내세웁니다. 올해 토큰을 요구하기 시작한 LocalStack 의 대안을 표방하며 커뮤니티판 종료나 기능 제한이 없다고 밝혔습니다. 클라우드 연동 코드를 CI 에서 비용 없이 시험하려는 팀이 볼 만합니다.
영상·음성·그래픽
NVIDIA Nemotron 3 Diarization: 공개 화자 분리 모델
Hugging Face
NVIDIA 가 녹음에서 누가 언제 말했는지 가려내는 화자 분리 모델 Nemotron 3 Diarization 을 공개 가중치로 내놨습니다. 화자는 최대 8명까지 다루고, 실시간 스트리밍과 녹음 파일 처리를 한 체크포인트로 모두 지원합니다. 입력을 모으는 지연을 최저 80ms 까지 낮출 수 있고 권장 최저 설정은 0.32초입니다. 상업적 사용이 가능한 라이선스이며 C++ 런타임 NeMo-Speech.cpp 로 로컬에서 돌릴 수 있습니다. 회의록·통화 녹취처럼 화자 구분이 필요한 음성 인식 파이프라인에 붙일 만합니다.
SplatLabel: 4D 가우시안 스플래팅으로 자율주행 라벨 자동 생성
Radiance Fields
SplatLabel 은 시간 축까지 담은 4D 가우시안 스플래팅 장면 표현으로 자율주행 데이터의 라벨을 자동으로 만드는 방법입니다. 라이다 점마다 의미 분할 라벨을 신뢰도와 함께 뽑고, 원하는 해상도의 3차원 의미 점유 격자도 생성합니다. 움직이는 물체를 시간 축에서 추적하므로 사람이 미리 그린 3D 상자가 필요 없다는 점이 핵심입니다. SemanticKITTI 데이터셋에서 기존 최고 방법을 꾸준히 앞섰다고 저자진은 밝혔습니다. 가우시안 스플래팅이 보여 주기용 렌더링을 넘어 학습 데이터 생산 도구로 쓰이는 흐름입니다.
깊이 읽을거리
Postgres SELECT DISTINCT Does Not Scale
DBOS
PostgreSQL 의 SELECT DISTINCT 가 고유값만 찾지 않고 조건에 맞는 행을 전부 훑는 문제를 DBOS 가 실제 큐 쿼리로 보여 준 글입니다. 파티션 키 3~10개만 돌려주면 되는 쿼리가 100만 행을 읽었습니다.
원인은 인덱스에서 고유값만 건너뛰며 찾는 연산(loose index scan)이 PostgreSQL 에 없기 때문이고, Postgres 18 의 skip scan 도 이 문제를 풀지 못합니다. DBOS 는 정렬된 인덱스에서 최솟값을 되풀이해 찾는 재귀 CTE 로 비용을 파티션 수에 비례하게 바꿨습니다.
왜 읽을 만한가쿼리 계획기가 무엇을 할 수 있고 없는지를 한 사례로 끝까지 따라가는 글입니다. 결과가 같은 두 SQL 이 왜 전혀 다른 양의 일을 하는지 이해하면, SQLite·PostgreSQL 어느 쪽이든 조회가 느려질 때 실행 계획을 읽는 눈이 달라집니다.
곁가지
LLM 시대에 프로그래밍을 계속 즐기는 법
Hacker News
하스켈 개발자가 코드는 사람이 직접 쓰고 LLM 은 계획·조사·문서화·코드 리뷰 같은 주변 일에만 쓰자고 제안한 글입니다. 생성된 코드는 그 모델이 계속 손볼 때만 잘 굴러간다고 지적하고, 전부 생성한 풀 리퀘스트는 보내지 말자고 합니다.
Postgres 마이그레이션, 안전한가 아닌가
Hacker News
PostgreSQL 마이그레이션 SQL 을 붙여 넣으면 테이블 크기 구간별로 위험한 작업을 짚어 주는 웹 도구입니다. WebAssembly 로 만든 PostgreSQL 파서가 브라우저 안에서만 분석해 SQL 이 밖으로 나가지 않는다고 밝힙니다.