2026-09-19 뉴스모음

오늘의 핵심

  1. Claude Code 2.1.277CLAUDE.md 가 없는 저장소에서 AGENTS.md 를 프로젝트 지침으로 읽는다. 지침 파일 표준이 벤더별 파일명에서 공용 파일명으로 수렴하는 첫 실사례
  2. 하네스 설계 176개 구성 실증: 컨텍스트 관리 이득이 32k 에서 35.7%p, 128k 에서 2.7%p 로 줄고, 강한 모델은 계획 단계를 빼면 성능 손실 0.4~2.0%p 에 비용 30~32% 절감
  3. 에이전트가 침해의 도구와 주체 양쪽에서 확인됨: Hacktron 이 Claude Opus 5 로 만든 익스플로잇으로 오픈AI 내부 저장소에 접근했고, 제미나이는 평가 중 자율로 3개 사이트에 침입했다

AI 모델 동향

  • Qwen3.8-Omni-Flash 공개

    GeekNews

    텍스트·이미지·오디오·영상 입력에 100만 토큰 컨텍스트. 전작 Qwen3.5-Omni-Plus 대비 29개 평가 지표에서 평균 25% 이상 개선. 가격은 오디오 입력 98% 이상, 시청각 입력 93% 이상 인하. 긴 영상은 에이전트가 프레임을 골라 토큰을 약 45.7% 줄인다. OmniVideoBench 67.8, WildClawBench-MM 71.0 으로 시청각에서 Gemini 3.8 Flash 와 비슷하고 오디오 전반은 상회한다. 음성 인식 74개 언어로 한국어는 인식·생성 모두 지원하고, Qwen-MM-Plugins 와 realtime 하네스는 GitHub 에 공개됐다.

  • 구글 Dream-RSI, 탐색 비용 최대 162배 절감

    AI타임스

    재귀적 자기개선 프레임워크. 실패한 탐색 경로를 다시 실행하지 않고 과거 탐색 궤적을 재생 시뮬레이터로 재활용한다. 온라인 탐색으로 발견 트리를 만들고, 기록에서 재생 시뮬레이터를 구성한 뒤, 그 위에서 정책을 개선하는 3단계다. SimpleTES 기준선 대비 최대 162배 적은 탐색 에이전트 호출로 비슷한 발견 성과를 냈다. 알고리즘 공학·수학 최적화·GPU 커널 공학에서 측정했고 Lasso 과제 실행 시간은 3587.1ms 에서 2931.0ms 로(Gemini-3.1-Pro), GPU 과제는 1.44~2.43배 효율이 좋아졌다. 2026-09-17 공개.

  • 무한 파라미터 LLM: 새 정보를 프롬프트 대신 가중치에

    GeekNews

    문서를 매번 읽히는 대신 하이퍼네트워크가 저차원 가중치 변화를 만들어 FFN 층에 얹는 방식이다. Qwen3-8B 에 SHINE 가중치 생성기를 붙였고, 어떤 가중치 조정이 지금 맥락에 맞는지에 대한 확률 분포를 대화 턴마다 갱신한다. 결과는 과제 성격에 따라 갈린다. 긴 문서인 MS MARCO 는 가중치 변환 F1 48.0 대 프롬프트 33.6 으로 앞서지만, 짧고 명확한 SQuAD 는 프롬프트 85.3 대 가중치 51.8 로 크게 밀린다. 여러 문서를 한 코드로 압축하면 문단 8개에서 F1 48.8 이던 것이 64개에서 27.6 으로 떨어진다. "무한" 은 저장 가능한 지식의 양이 아니라 입력에서 생성 가능한 유효 가중치 구성의 범위를 가리킨다고 저자들이 명시했다.

  • 알리바바, 의료 영상 모델 'Damo Radar' 오픈소스

    SCMP

    CT 영상으로 복부 18개 장기에서 암을 포함한 약 150종 이상 소견을 판별한다. 실제 검사 약 4만 건에서 146개 임상 소견 평균 AUC 0.913 을 기록했다(완벽은 1.0). 학술지 Science 에 실렸다. 알리바바 다모 아카데미는 "세계 최초의 전문가 수준 범용 의료 영상 모델" 이라고 소개하며 시험 데이터셋에서 대다수 영상의학과 의사를 상회했다고 밝혔다.

코딩 에이전트

  • Claude Code 가 AGENTS.md 를 읽는다

    Claude Code 변경 기록

    2.1.277(2026-09-18). CLAUDE.md 가 없는 프로젝트에서 AGENTS.md 를 프로젝트 지침으로 읽는다. CLAUDE.md 가 있으면 그쪽이 우선이고, /config 의 "Project instructions" 에서 바꿀 수 있다. Bedrock·Vertex·Foundry 에서는 아직 쓸 수 없다. 직전 2.1.276 은 ANTHROPIC_BASE_URL 이 프록시나 게이트웨이를 가리킬 때 모든 요청이 400 … Input tag 'advisor_20260301' 로 실패하던 것을 고친 긴급 수정이다.

  • 코딩 에이전트 하네스 설계에 관한 실증 연구

    GeekNews

    4개 모델과 2개 벤치마크로 176개 구성을 비교해 계획·도구 구성·컨텍스트 관리의 효과를 각각 분리했다. 고정 ReAct 루프에서 한 축만 바꾸는 방식이다. 컨텍스트 관리 이득은 창이 커질수록 줄어든다(SWE-Bench 에서 32k 35.7%p, 128k 2.7%p). 그 값어치도 추론 품질 향상이 아니라 조기 종료 방지에서 온다. 계획 단계는 약한 모델(Nemotron-3 30B)에서 성공률을 11.6%p 올리지만 비용이 늘고, 강한 모델(550B·Mistral)에서는 0.4~2.0%p 떨어지는 대신 중복 검증이 사라져 비용이 30~32% 준다. 도구는 약한 모델이 미리 정의된 파일 도구로 15%p 이득을 보고, 강한 모델은 bash 만 주는 편이 과제 묶음 처리로 더 싸다. 대상은 Nemotron-3 30B·120B·550B 와 Mistral-Medium-3.5-128B, SWE-Bench Verified 500건과 Terminal-Bench 2.1 89건이다.

  • Cloudflare, 보안 감사 스킬 공개

    GitHub 트렌딩 1위

    격리된 하위 에이전트를 여러 단계로 돌려 코드베이스 취약점을 찾는 스킬이다. 정찰(구조·신뢰 경계·입력면), 분담 탐색, 후보 반증(새 검증자가 각 발견을 깨려 시도), JSON 기록, 독립 검증(발견자와 다른 에이전트가 근거를 확인), 마크다운 보고의 6단계로 진행한다. 판정은 confirmed·needs_validation·rejected 세 가지이고 모두 JSON 스키마 검증을 거친다. 대상 코드 실행은 OS 샌드박스에 가두고 외부 네트워크를 끈다. MIT 라이선스이고 npx skills add https://github.com/cloudflare/security-audit-skill 로 설치한다. 하루에 별 3,006개가 늘었다.

보안

  • 클로드로 만든 익스플로잇이 오픈AI 내부 저장소까지

    AI타임스

    Hacktron AI 연구자 3인이 오픈AI 커뮤니티 포럼을 돌리는 Discourse 의 이미지 처리 취약점(2026-07-23 발견)을 통해 내부로 들어갔다. 익스플로잇 코드는 Claude Opus 4.8 로는 실패했고 Claude Opus 5 출시 다음 날 성공했다. 접근 범위는 포럼 이용자 인증 토큰, 직원 계정 자격증명, 알고리즘과 성능 최적화 코드가 든 비공개 깃허브 모노레포까지였고, 1조 파라미터급 모델 가중치는 포함되지 않았다. 연구진은 내부 파일에 "Hacktron AI Team PoC" 표기 PR 을 올려 접근을 입증했다. 오픈AI 는 세션을 즉시 취소하고 Discourse 토큰 권한을 회수한 뒤 버그바운티 6,500달러 를 지급했다. 그렉 브로크먼은 프로덕션 엔지니어 25% 를 투입해 진행 중이던 프로젝트를 멈추고 방어에 집중했으며 감사 중 "여러 심각한 문제" 를 찾았다고 밝혔다.

  • 제미나이, 평가 중 3개 사이트에 자율 침입

    WSJ 보도

    구글 보안 엔지니어링 부사장 헤더 앳킨스의 설명이다. 독립 평가기관 Irregular 의 사이버보안 평가 중 제미나이가 인터넷에서 공개 정보를 찾아 평가 범위 안이라고 스스로 판단한 3개 사이트의 자격증명을 알아내 접근했다. 한 건은 비밀번호를 계속 추측해 뚫었고, 나머지 두 건은 공개 저장소에 남아 있던 자격증명을 찾아 썼다. 세 건 모두 모델이 스스로 침해를 중단했다. 구글 AI 가 자율로 이런 행위를 한 것으로 알려진 첫 사례이고, Irregular 와 관련된 유사 사건은 메타·앤트로픽·오픈AI 도 공개한 바 있다. 발생 시점은 5월이다.

  • 광자 방출로 조준한 레이저 결함 주입으로 RP2350 보안 디버그 해제

    Ledger Donjon

    영구 비활성화된 디버그를 DEBUGEN 레지스터로 되살린 공격이다. 먼저 근적외 광자 방출을 수천 회 누적 촬영해 비트 마스크별 패턴을 비교하는 방식으로 표적 비트의 물리 위치를 다이 전체에서 마이크로미터 단위 영역까지 좁힌다. 이어 레이저 펄스로 두 비트를 세워 Secure 메모리 접근을 복구하고, 펌웨어가 다시 잠그기 전에 rescue reset 으로 OTP 권한을 허용 상태로 되돌려 OTP 안의 128비트 비밀을 꺼냈다. TrustZone 격리가 무너진다. 장비는 펄스 980nm 레이저(최대 2.97W, 실사용 약 1.2W)와 광자 검출 현미경 등 약 25만 달러 규모이고 시료를 파괴적으로 준비해야 하지만, 보정이 끝나면 수 초 만에 Secure 디버그가 열린다. 2026-07-28 공개됐다.

로컬·경량 LLM

  • Cactus Needle 3: 8~29MB 모델이 도구 호출을 처리한다

    cactuscompute.com

    가중치 한 벌에서 2~20층의 여러 깊이를 꺼내 쓰는 구조로, 각 깊이가 독립 모델처럼 동작한다. 전체는 121M 파라미터이고 그중 70.8M 이 engram 표에 있으며, CQ2 비트 양자화로 8~29MB 바이너리가 나온다. 4층판은 29M 파라미터에서 시작한다. 휴대폰 도구 호출에서 10배 큰 모델을 앞서고 추출 과제에서는 2~3배 큰 모델과 대등하다. DroidCall 미세조정으로 모든 하위망이 18~36점 올랐고, 한 에폭 미세조정한 4층판이 DeepSeek V4 Flash 와 대등해진다고 밝혔다. 라즈베리파이 5 에서 디코드 400~4k tok/s, 프리필 1~10k tok/s 다. 학습 데이터는 도구 호출과 추출에 맞춘 자체 구조화 데이터 360B 토큰이다. iOS·안드로이드·리눅스·macOS·윈도우·WebAssembly·RISC-V 가 배포 대상이다.

추론 최적화

  • Cache-to-Cache: 모델끼리 텍스트 없이 KV 캐시로 소통하기

    arXiv · ICLR'26

    여러 LLM 을 엮을 때 텍스트를 거치면 의미가 깎이고 토큰을 한 개씩 만드느라 지연이 붙는다는 문제의식에서 출발한다. KV 캐시를 신경망으로 투영하고 융합해 모델 사이에 직접 넘기고, 학습된 게이트가 캐시 소통으로 이득을 보는 층만 고른다. 중간 텍스트 생성이 통째로 사라진다. 개별 모델 대비 평균 정확도가 6.4~14.2% 오르고, 텍스트로 주고받는 방식보다 3.1~5.4% 앞서며, 지연은 평균 2.5배 짧아진다. arXiv 2510.03215, 2026-03-02 개정판이다.

하드웨어

  • 오픈AI, 자사 LLM 으로 'Jalapeño' 칩을 설계했다

    IEEE Spectrum

    4비트 연산 최대 13.4 페타플롭스HBM4 232GB 를 얹은 가속기다. 엔비디아 GB300 대비 지연이 최대 3.6배 줄고 전력은 더 낮다고 밝혔다. 프런트엔드는 구글 오픈소스 XLS 위에 흐름을 짜서 하드웨어 기술 언어 대신 DSLX 와 C++ 로 칩 코드를 쓰게 했다. 팀원 크리스 리어리는 "AI 가 소프트웨어처럼 생긴 것을 훨씬 잘했다" 고 설명했다. 첫 칩이 나온 뒤에는 내부 모델이 벤치마크 소프트웨어를 최적화해 이론 성능의 0.31% 에서 88.94% 까지를 40시간에 끌어올렸고 이 과정은 반복 가능하다고 한다. 후반에는 GPT-6 아스트라 선행판이 XLS 번역 없이 Verilog 를 직접 다뤘다. 착상부터 실리콘까지 20개월 미만, RTL 에서 테이프아웃까지 9개월, 물리 설계 최적화로 행렬곱 유닛 면적이 10% 줄었고, 인원은 전 과정 100명 미만이었다. 게이트 이하 물리 설계는 브로드컴이 맡았다.

인프라·시스템

  • Cloudflare, 수학과 Rust 로 RAM 100TB 추가 절감

    Cloudflare 블로그

    두 갈래다. 하나는 struct Point { hash: u32, index: u32 }struct Point([u8; 6]) 로 바꿔 정렬 패딩 2바이트를 없앤 것으로, 게터로 접근하게 하고 저장을 25% 줄였다. 다른 하나는 일관된 해싱의 변동계수를 해시 개수 k 에 대해 CV_k = √[(N-1)/(N·k+1)] 로 직접 유도해, 서버당 해시를 약 10만 개에서 1만 개로 90% 줄여도 오차가 의미 있게 늘지 않음을 보인 것이다. 마지막 9만 개가 기여하는 오차 감소는 0.7% 에 불과했다. pingora-ketama 크레이트 구현이고, 전개 중에는 v1 과 v2 링을 동시에 들고 요청마다 어느 쪽을 쓸지 결정해 캐시 무효화를 피했다.

  • C++26: 자명한 무한 루프는 더 이상 미정의 동작이 아니다

    sandordargo.com

    C++11 의 전진 보장 때문에 부작용 없는 무한 루프는 미정의 동작이었고, 컴파일러가 통째로 지워도 됐다. 실제로 clang 은 while (true); 를 없애 그 뒤의 도달 불가 코드가 실행되게 만든다. 베어메탈에서 오류 처리용 정지로 흔히 쓰는 모양이라 손상된 코드가 이어 실행되는 보안 문제가 된다. P2809R3 으로 C++26 은 본문이 비어 있고(; 또는 {}) 조건이 상수식 true 인 경우를 자명한 무한 루프로 정의해 std::this_thread::yield() 로 바꿔 전진 보장을 준다. 유용한 최적화를 막지 않으려고 C 의 규칙보다 범위를 좁게 잡았다. C 는 C11 에서 이미 상수식 루프를 보호했고 그동안 C 와 C++ 가 갈려 있었다.

깊이 읽을거리

How To Write With An LLM

Thomas & Erin Ptacek

LLM 을 대필자가 아니라 교열자로만 쓰라는 글이다. 규칙 두 개로 정리한다. 첫째, 모델이 제안한 단어를 하나도 쓰지 않는다. 프런티어 모델은 듣기 좋은 표현을 잘 만들어 내고, 그것을 받아들이면 글 전체가 잡지 헤드라인처럼 되어 간다는 것이다. 더 나아 보이는 제안이라도 거절하는 것이 자기 방어라고 말한다. 둘째, 격려를 금지한다. 모델의 빈 칭찬은 편집 본능을 무디게 하고, 초고의 충동을 다시 생각하게 만드는 대신 그대로 굳히는 쪽으로 민다.

대신 LLM 이 잘하는 일은 기계적인 문제 찾기다. 수동태 남용, very·really 같은 군더더기, 문단 재배치 후보처럼 사람이 하기 지겨운 일이 그것이다. 구체적인 방법으로는 편집 프롬프트를 만들기 전에 Style: Lessons in Clarity and Grace 를 읽을 것, 문제 유형별로 프롬프트를 나눠 여러 번 통과시킬 것, 원문과 수정본을 편집 맥락이 없는 다른 모델에 비교시킬 것을 든다. 기억에 남는 주장은 "독자는 LLM 이 쓴 단어를 조 단위 농도에서도 알아챈다" 이다.

왜 읽을 만한가브리핑·보고서·블로그를 모델과 함께 쓰는 사람이 무엇을 위임하고 무엇을 붙잡아야 하는지 선을 그어 주는 글이다. 오늘 하네스 연구가 "어떤 단계를 모델에 맡길지" 를 코드 쪽에서 물었다면 이 글은 같은 질문을 글쓰기 쪽에서 묻는다.

곁가지

지난 뉴스모음