뉴스모음

오늘의 핵심

  1. HarnessTax 실측 공개: 같은 모델이라도 하네스를 바꾸면 토큰 비용이 최대 5배 차이, 성공률 차이는 ±2~5%. 12개 비교 중 9개에서 벤더 자체 하네스보다 타사 하네스가 우위
  2. ZCode(Z.ai 코딩 에이전트)가 .git 전체 이력·LFS·전역 설정을 무단 업로드하고 복호화 키를 서버만 보유하는 구조로 확인. 에이전트 신뢰 경계가 스킬 공급망에서 CLI 본체로 확대
  3. 27B 급 로컬 구동 경로가 두 갈래로 굳음: 3진 압축 Bonsai 2 27B 5.9GB·98.2%ShapeLearn IQ4_XS 13.1GB·99.63%

AI 모델 동향

  • 구글 'R4T', AI 검색 속도 최대 20배

    AI타임스

    Retrieve-for-Train. 4B 모델(Gemma 3-4B·Qwen3-4B)을 강화학습으로 검색 전략에 맞춘 뒤 그 전략을 53.9M 확산 모델로 증류. 자기회귀 토큰 생성을 비자기회귀 확산으로 대체해 임베딩 여러 개를 동시 생성. 배치 8 에서 1.46초 → 0.07초, 배치 1024 에서 약 50초 → 4.21초.

  • 앤트로픽, 내부 R&D 자동화 지표 공개

    AI타임스

    Epoch AI 의 자동화 수준(AL0~AL5) 척도로 측정. 클로드가 주도하는 R&D 과제 비중 26%(2026-02 1% 미만에서 2026-08 기준), 협업 이상 수준 90%. 완전 자율(AL5) 도달 과제는 없음. 동시 가동 연구·엔지니어링 에이전트 약 3만 개의 감독 커버리지·검토 지연·에스컬레이션 비율을 함께 추적.

  • 제논, '훈민 VLM 397B' 오픈소스 공개

    AI타임스

    큐원3.5-397B 기반 화면 인식·컴퓨터 조작 특화. ScreenSpot-Pro 75.6점(허깅페이스 리더보드 2위), OS월드 70.5점(기본 대비 +22.3), WindowsAgentArena +9.1. 한국어 벤치 8종은 기본 모델 대비 2점 이내 유지. 아파치 2.0, FP8 양자화판 동봉, B200 8장으로 개발.

  • OpenJev: 토큰 대신 선택지 확률을 내놓는 모델

    Hacker News 281pt

    Jev 방식의 독립 오픈소스 재현. 문장을 생성하는 대신 선택지별 확률을 JSON 으로 쓰게 하는 경로와, 토큰 생성 없이 선택지 로짓을 직접 읽는 경로를 같은 질문으로 비교. 모델 3종 제공(Qwen3 0.6B 639MB · MiniCPM5 2B 1.56GB · Qwen3.5 4B 3.01GB). 2B 균형 정확도 네이티브 68.6%·TypeSafe 63.7% 로 원 발표치 88.3% 에는 미달이라고 스스로 명시.

코딩 에이전트

  • HarnessTax: 하네스는 얼마나 중요한가

    GeekNews

    7개 모델 × 3개 하네스(클로드 코드·코덱스 CLI·Pi)를 SWE-bench Lite·Terminal-Bench 2.0 각 무작위 30과제·3회 반복으로 비교. 2026-09 API 단가 기준, 부트스트랩 1만 회 재표집으로 95% 신뢰구간 산출. 같은 모델·다른 하네스에서 토큰 비용 최대 5배 차이, 성공률 차이는 SWE-bench ±2%·Terminal-Bench ±5%. SWE-bench Lite 에서 클로드 코드가 Pi 대비 약 2배 비용, 초기 컨텍스트는 10배. 12개 교차 비교 중 9개에서 타사 하네스가 벤더 자체 하네스보다 우위.

  • ZCode 가 git 이력을 올리고, 복호화 키는 Z.ai 만 가진다

    Hacker News 192pt

    연구자가 app.asar 를 재구성해 업로드 파이프라인을 역추적. 업로드 대상은 작업공간 전체로 .git 이력·LFS 자산·reflog·전역 앱 설정 포함. 매니페스트 구성비는 LFS 56.8%, git objects 29.6%, 소스·문서 13.4%. 345MB 상용 작업공간(42,411 파일)이 313MB 암호화 아카이브로 전송. 설정의 두 스위치는 각각 학습 승인·서버측 색인만 제어해 실질 opt-out 없음. 봉투 암호화(AES-256-CTR + RSA-OAEP)이고 복호화 키는 서버만 사용 가능.

  • 앤트로픽, '클로드 코드 프로젝트' 공개

    AI타임스

    2026-09-17 출시. 코디네이터 AI 가 클라우드 세션 여럿을 병렬 조율하고 스레드마다 자체 브랜치·저장소 사본을 씀. 공유 메모리로 결정사항 유지. Pro·Max 베타, 로컬 환경 지원 예정.

  • 스킬 무단 업데이트 공급망 취약점 'Plugin4Shell'

    AI타임스

    스킬 최초 등록 시점에만 악성코드를 검증하고 이후 업데이트는 재검증하지 않음. 클로드 코드·코덱스·제미나이 CLI·깃허브 코파일럿 영향. 보안 스타트업 에어(Air)가 2026-06 발견. 앤트로픽·오픈AI 패치 완료, 구글은 지원 종료로 사용 중단 권고.

  • jcode · Zed Delta: 병렬 세션과 PR 대체 시도

    GeekNews

    jcode 는 Rust 로 쓴 터미널 코딩 에이전트로 세션당 약 10MB(코덱스 CLI 의 약 1/2, 클로드 코드의 약 1/20)라 수십 개를 동시에 띄움. 에이전트 간 메시지·읽은 파일 변경 알림·하위 에이전트 위임을 갖춤. 별건으로 Zed 가 Delta 퍼블릭 베타를 열어 풀 리퀘스트를 대체하는 멀티플레이어 코딩 환경을 목표로 내놓음.

로컬·경량 LLM

  • ShapeLearn Qwen3.8 27B: 13.1GB 에 품질 99.63%

    Hacker News 89pt

    16GB~96GB VRAM GPU 6종에서 측정. 권장판은 IQ4_XS·13.1GB 로 BF16 종합 벤치의 99.63% 를 유지하고 RTX 4090 에서 59.2 tok/s. 더 작은 11GB·IQ3_S 판은 98.72% 로 더 빠름. 추측 디코딩은 DFlash2 가 거의 모든 경우 MTP 보다 빠름(기준 대비 1.34~2.10배 대 1.28~1.66배). 다만 DFlash2 는 약 1.1GB 를 더 쓰고 llama.cpp 에서 멀티모달 입력을 지원하지 않음.

  • Bonsai 2 27B: 9배 작은 크기로 거의 무손실 압축

    Hacker News 505pt

    Qwen3.8 27B 기반 3진 양자화. 5.9GB·9배 축소로 전정밀도 대비 98.2% 유지. 허깅페이스 GGUF 배포본이 다운로드 405,609·좋아요 697 로 당일 급상승.

추론 최적화

  • Transformer Engine 으로 JAX Dropless MoE 학습 처리량 10배

    PyTorchKR · NVIDIA

    세 부품으로 구성: 전문가 경계를 인식하는 Group-Aware MXFP8 양자화, 전문가 전체를 커널 한 번으로 처리하는 MXFP8 grouped GEMM, dispatch·combine 을 NCCL 로 융합한 전문가 병렬. 671B MoE 학습에서 GPU 당 103~105 TFLOPs 에서 1,025 TFLOPs 로. 단계별 기여는 grouped GEMM + 멀티스트림 집합통신 4배, MXFP8 1.7배, all-to-all·permute 융합 1.4배. 1,024 GPU 에서 97% 확장 효율. 핵심은 GPU 간 통신 오버헤드를 84% 줄여 통신 병목을 연산 병목으로 옮긴 것.

  • RLT: 순환 루프 트랜스포머

    PyTorchKR

    병렬 처리 인과 인코더와 순차 처리 순환 디코더의 조합. 직전 토큰의 디코더 최종 출력을 게이트 병합으로 다음 토큰 계산에 되먹여 연산 깊이가 시퀀스 길이에 따라 자람. 8층 예비 실험에서 500스텝 기준 parity 99.44%(기준선 48.48%), 괄호 없는 모듈러 연산 95.44%(기준선 20.57%). 저자들이 제거 실험·처리량 측정·RL 성능이 빠졌다고 스스로 명시.

하드웨어

  • FUJITSU-MONAKA 정식 출시, 11월 판매

    Hacker News 615pt

    Armv9 기반 144코어 서버 프로세서. 36코어 연산 칩렛 4개를 TSMC N2(2nm) 로 만들고 N5 SRAM 캐시 타일 위에 하이브리드 구리 본딩으로 적층. 최대 3.8GHz, DDR5 12채널 8,800MT/s, PCIe Gen6, 코어당 256비트 SVE2 벡터 유닛 2개와 행렬곱 가속기. 350W·500W 두 SKU.

  • 화웨이, 차세대 AI 칩 출시 앞당김

    AI타임스

    어센드 960DT 를 2027년 3분기에서 1분기로 두 분기 당김. 970 은 2028, 980 은 2029 로 연간 출시를 공언. 개별 칩 성능 대신 최대 100만 프로세서를 한 덩어리로 묶는 확장 전략을 앞세움. 대형 모델 학습 시간의 40% 이상이 칩 간 통신이라는 점을 근패키지 광학으로 상쇄하겠다는 것. 소프트웨어 생태계는 여전히 열위.

데이터·도구

  • Hister: 방문한 페이지와 보관 중인 파일을 위한 개인 검색엔진

    Hacker News 665pt

    브라우저 확장이 방문 페이지를 자동 수집해 본인이 지정한 서버로만 전송. 방문기록 수동 가져오기와 사이트 크롤링을 지원하고 로컬 디렉터리 색인을 붙여 웹·로컬 문서를 한 질의로 검색. 필드 필터·구문·와일드카드·부정을 갖춘 전문 검색이 기본이고, 임베딩 엔드포인트를 지정하면 의미 검색이 선택적으로 붙음. 웹 UI·터미널·MCP 세 경로. 필수 클라우드 서비스·텔레메트리 없음, AGPLv3.

깊이 읽을거리

The scourge of x86 emulation

FEX-Emu · Hacker News 203pt

x86 의 TSO(Total Store Ordering)를 Arm 의 약한 순서 메모리 모델 위에서 흉내 내는 문제를 실무 관점에서 끝까지 따라간 글. 순진한 해법인 "모든 로드를 load-acquire, 모든 스토어를 store-release 로" 는 기능적으로는 맞지만 Arm CPU 가 그 명령이 실행을 지배하도록 설계되지 않아 성능이 무너진다는 데서 출발한다.

이어 정렬 문제(x86 은 비정렬 접근을 허용하지만 Arm 은 자연 정렬을 요구해 패치포인트를 폴트 후 메모리 배리어로 교체, 일부 플랫폼에서 50% 손실), 캐시라인을 가로지르는 split-lock 원자 연산(커널 시그널로 처리해 연산당 수천 사이클), 하드웨어 지원(FEAT_LRCPC 의 TSO 로드, 애플의 스레드 단위 TSO 모드 토글로 5% 대 50%+)까지 내려간다. 마지막의 write-combined 메모리 사례가 압권으로, 언캐시드 GPU 메모리에서 x86 네이티브 대비 대역폭 816배 감소를 보고한다.

왜 읽을 만한가메모리 모델·원자성·정렬을 추상적으로가 아니라 "이 명령을 저 명령으로 바꿨을 때 몇 배 느려지는가" 로 설명하는 자료는 드물다. GPU·추론 커널을 다루면서 배리어와 원자 연산 비용을 감으로만 알고 있었다면 기준을 잡아 주는 글.

곁가지

  • 마틴 파울러 "나는 LLM 이 마음에 들지 않는다"

    GeekNews

    생산성 이득은 인정하되 유용함과 편안함은 별개라는 글. 지어낸 답을 맞는 답과 같은 확신으로 내놓고, 지적받으면 공허한 사과를 하는 화법을 문제 삼는다. 핵심 논지는 "LLM 은 사람을 흉내 내는 게 아니라 내가 경력 내내 피해 온 종류의 사람을 흉내 낸다".

  • jemalloc 5.4.0

    Hacker News 237pt

    160여 커밋의 기술부채 정리 릴리스. 회수 불가 매핑을 표시하는 플래그 추가, thread.arena 로 per-CPU arena 선택 재개, 플랫폼 의존 코드를 분리한 OS 추상화 계층 도입. 레거시 tcache 옵션 7종 제거는 비호환 변경.