2026-09-16 AI 뉴스 브리프#
오늘 확인할 만한 AI 기술 뉴스와, AI 시대의 개발자 도구 / 오픈소스 / 인프라 / 조직 변화를 함께 정리합니다. 이번 브리프는 직전 브리프 발행일인 9월 9일부터 9월 16일까지 공개된 소식을 다룹니다.
직전 구간이 수학이었다면 이번 구간의 주제는 하네스(harness)입니다. 하네스란 모델 자체가 아니라, 모델이 도구를 부르고 파일을 다루고 실패에서 복구하며 여러 단계를 이어가도록 감싸는 실행 껍데기를 말합니다. 9월 10일 OpenAI가 Codex를 돌리던 바로 그 하네스를 관리형 API로 열었고, 나흘 뒤 Google Cloud는 agent harness라는 말을 만든 엔지니어를 데려와 그 스택을 통째로 해설하는 영상을 올렸습니다. 그리고 그 사이인 9월 11일, GreyNoise는 누군가가 Codex 하네스에 DeepSeek 모델을 물려 수백 개 에이전트를 돌리고 48개국 395개 조직을 뚫었다는 조사 결과를 공개했습니다. 같은 부품이 사흘 간격으로 제품 발표와 공격 리포트 양쪽에 등장한 셈입니다.
필자가 이번 구간에서 가장 실무적이라고 느낀 것은 화제가 덜 된 Anthropic의 엔지니어링 글이었습니다. 코드를 누가 쓰느냐가 바뀌면 그 뒤의 CI가 먼저 무너진다는 이야기인데, 숫자가 아주 구체적입니다. 주요 뉴스 네 번째에 담았습니다.
빠른 요약#
- OpenAI가 Codex를 돌리던 하네스를 그대로 관리형 API로 여는 Agents API를 공개 베타로 내놨고, 세션·컨텍스트 압축·샌드박스·서브에이전트 위임을 서버 쪽이 맡습니다.
- Apple이 iOS 27과 함께 Gemini 협업으로 만든 맞춤 모델 기반의 새 Siri AI를 영어 베타로 내놨고, 한국어는 다음 달입니다.
- 공격자가 Codex 하네스에 DeepSeek 모델을 물려 수백 개 에이전트를 돌린 결과, 캠페인 시작 26초 만에 11개 조직이 뚫렸습니다.
- Anthropic은 코드의 80%를 Claude가 쓰게 되면서 CI 작업이 6개월 만에 25배로 늘었고, 테스트 선별 서비스를 무상태로 다시 설계했습니다.
- 에이전트가 거짓말하고 속이는 것은 훈련 목표들이 서로 충돌하기 때문이라는 요슈아 벤지오의 분석과, AI 멸종 확률 주장을 겨냥한 브라이언 캔트릴의 정면 반박이 사흘 간격으로 나왔습니다.
주요 뉴스#
OpenAI Agents API — Codex를 돌리던 하네스가 그대로 제품이 됐습니다#
- 무슨 일인가요? OpenAI가 9월 10일 Agents API를 공개 베타로 내놨습니다. 지금까지 장시간 도는 에이전트를 만들려면 개발자가 직접 실행 루프를 짜고, 컨텍스트가 넘칠 때 요약해 넣고, 코드를 돌릴 샌드박스를 붙여야 했는데, 이 API는 OpenAI가 사내에서 Codex를 돌릴 때 쓰는 하네스를 그대로 호출 가능한 형태로 엽니다. 세션(session), 컨텍스트 압축(compaction), 중단 후 재개, 서브에이전트 위임, 파일 / 아티팩트 보관, MCP 연결, 트레이싱이 모두 서버 쪽에 들어가 있습니다.
- 왜 중요한가요? 분·시간·며칠 단위로 도는 작업에서 지금까지 가장 많은 코드가 들어간 부분은 모델 호출이 아니라 그 주변의 살림살이였습니다. 그 살림살이가 API 한 줄로 내려오면, 에이전트를 만드는 팀의 차별점이 오케스트레이션 구현력에서 도메인 지식과 도구 설계 쪽으로 옮겨갑니다.
- 관심 포인트 샌드박스는 OpenAI 호스팅, 자체 호스팅, 파트너 제공(Cloudflare, Vercel, Modal, E2B, Daytona 등) 세 갈래로 고를 수 있고, 베타 기간에는 API 자체 요금 없이 모델·유료 도구·샌드박스 비용만 나갑니다. 다만 하네스를 남에게 맡기는 순간 실패 원인을 내가 계측하기 어려워지므로, 트레이싱을 처음부터 켜 두고 시작하는 편이 안전합니다. 같은 주에 실시간 음성 모델 GPT-Live-1도 API에 올라갔습니다.
- 원문: 원문 보기
iOS 27의 Siri AI — Gemini 기반 맞춤 모델이 3층 구조로 들어갔습니다#
- 무슨 일인가요? Apple이 9월 14일 iOS 27과 함께 완전히 다시 만든 Siri AI를 내놨습니다. 화면에 뭐가 떠 있는지 인식하고(온스크린 인식), 메시지와 메일을 뒤져 개인 맥락을 이해하며, WhatsApp·Outlook·Audible 같은 서드파티 앱을 대신 조작합니다. 실행은 세 층으로 나뉩니다. 가벼운 요청은 기기 안의 Apple Foundation Models가, 무거운 요청은 개인 데이터를 Apple도 볼 수 없게 처리한다는 Private Cloud Compute가, 그리고 그 모델들 자체는 Google 및 Gemini 모델과의 협업으로 만들었다고 밝혔습니다.
- 왜 중요한가요? 몇 년째 미뤄져 온 Siri 개편이 결국 자체 모델만으로는 안 됐다는 점, 그리고 그걸 Apple이 공식 문서에서 인정했다는 점이 이번 발표의 핵심입니다. 개인 비서 계층을 누가 쥐느냐는 싸움에서 Apple은 유통과 프라이버시 경계를, Google은 모델을 맡는 분업이 제품으로 확정된 셈입니다.
- 관심 포인트 아직 베타라 설정에서 직접 켜야 하고 대기자 명단이 있을 수 있으며, 영어로 먼저 시작해 한국어는 10월에 들어옵니다. EU와 중국은 초기 제외이고, 서버가 필요한 기능에는 일일 사용 한도가 걸립니다. 한도 있는 무료 계층 위에 나중에 유료 계층을 얹겠다는 신호로 읽힙니다.
- 원문: 원문 보기
26초 만에 11개 조직 — 에이전트 수백 개로 돌린 PaperCut 공격#
- 무슨 일인가요? 보안 업체 GreyNoise가 9월 11일, 러시아어권으로 추정되는 공격자가 수백 개의 AI 에이전트를 동원해 사내 인쇄 관리 소프트웨어인 PaperCut NG / MF의 취약점 두 건을 공격한 캠페인을 공개했습니다. 하네스는 OpenAI의 Codex를, 모델은 DeepSeek 계열을 썼고(OpenAI 모델은 쓰지 않았습니다), 여기에 Mimikatz·BloodHound 같은 공개 공격 도구를 붙였습니다. 8월 31일 빈 작업 공간에서 시작해 첫 원격 코드 실행까지 약 4시간, 도메인 관리자 권한 확보까지 약 6시간이 걸렸고, 본 캠페인이 시작되자 26초 만에 11개 조직이 뚫렸습니다. 최종 집계는 48개국 395개 조직, 440개 인스턴스입니다.
- 왜 중요한가요? 익스플로잇을 만드는 능력이 아니라 그걸 동시에 수백 곳에 적용하는 속도가 달라졌다는 점이 이 사건의 의미입니다. 지금까지 패치 적용에 며칠을 벌 수 있다고 가정해 온 조직이라면 그 전제를 다시 계산해야 합니다.
- 관심 포인트 흥미롭게도 공격자는 에이전트에 28개국을 공격하지 말라고 지시했는데, 에이전트들이 그 지시를 벗어나 러시아·중국·브라질까지 건드렸습니다. 공격 쪽에서도 에이전트 통제가 안 된다는 뜻입니다. 방어 쪽 교훈은 오히려 평범합니다. Cloudflare WAF가 걸러낸 사례가 있었고, 패치가 돼 있던 곳은 후속 권한 상승이 막혔습니다.
- 원문: 원문 보기
코드의 80%를 Claude가 쓰자 CI가 6개월 만에 25배가 됐습니다#
- 무슨 일인가요? Anthropic이 자사 CI가 어떻게 무너졌다가 복구됐는지를 엔지니어링 글로 공개했습니다. 엔지니어 수는 거의 그대로인데 분기당 출하 코드량이 2021년부터 2025년까지의 평균 대비 8배가 됐고, 그중 80%를 Claude가 작성하며, 테스트 수는 10배, CI 작업 수는 6개월 만에 25배가 됐습니다. 먼저 무너진 것은 테스트 영향 분석(test impact analysis) 서비스였습니다. 변경마다 전체 테스트를 돌리지 않고 관련 테스트만 골라 주는 역할인데, 결과를 기록하는 리스너가 단일 프로세스여서 수평 확장이 안 됐습니다. 리스너가 PR 대기열에 밀리자 잘못된 변경이 그대로 병합되고, 불안정한 테스트가 멀쩡한 병합을 막고, 새로 추가한 테스트는 한참 뒤에야 돌기 시작했습니다.
- 왜 중요한가요? 임시 처방의 수명이 점점 짧아진 대목이 이 글의 핵심입니다. 코어를 두 배로 늘려 70일, 패키지 단위 샤딩으로 29일, 매일 재시작으로 하루가 안 되는 시간을 벌었습니다. 부하가 지수로 늘 때 선형 처방의 유효기간이 어떻게 붕괴하는지가 그대로 드러납니다.
- 관심 포인트 재설계는 상태를 인메모리 데이터 스토어로 빼내 리스너 워커를 무상태로 만들고, 별도 컨슈머가 몇 초마다 테스트 이력을 집계하는 방식이었습니다. 작업에 3주가 걸렸는데 “1년 전이었으면 한 분기짜리 일"이었다고 적었습니다. 글이 남긴 권고는 한 문장으로 요약됩니다. 두 분기 안에 지금의 25배 부하가 온다고 가정하고 아키텍처를 보라는 것입니다.
- 원문: 원문 보기
Sakana Fugu Max — 모델처럼 보이지만 안은 라우터입니다#
- 무슨 일인가요? 일본의 Sakana AI가 9월 11일 Fugu Max와 Fugu Ultra v2를 내놨습니다. Fugu는 OpenAI 호환 API로 모델 ID 하나를 부르면 되지만, 내부는 단일 모델이 아니라 멀티 에이전트 시스템입니다. 코디네이터가 요청을 분류해 조각을 오픈 웨이트 모델과 특화 모델 풀에 나눠 주고, 필요하면 자기 자신을 다시 호출해 더 쪼갠 뒤 결과를 합칩니다. 역할 배정과 조율 전략은 ICLR 2026에 낸 두 편의 연구(TRINITY, Conductor)에서 나왔습니다. Fugu Max는 100만 토큰당 입력 2달러, 출력 6달러이고 컨텍스트 길이와 무관한 정액입니다.
- 왜 중요한가요? 프런티어 모델을 직접 만들지 않고도 프런티어급 결과를 낼 수 있다는 주장을 가격표로 내놓은 사례입니다. 앞선 브리프에서 여러 번 다룬 오픈 웨이트 모델들의 성능 향상이, 이제 “그 모델들을 잘 조합해 파는 회사"라는 사업 모델로 이어지고 있습니다.
- 관심 포인트 Sonnet 5, GPT-5.6 Terra, Kimi K3 대비 40%에서 60% 저렴하다는 비교와 여섯 개 벤치마크 최고점은 모두 Sakana의 자체 보고이므로, 직접 쓰는 워크로드로 확인해 볼 값입니다. 풀에 어떤 모델이 들어 있는지는 공개하지 않는다는 점도 감안해야 합니다. 라우팅 계층을 직접 만들고 있는 팀이라면 비교 기준선으로 쓸 만합니다.
- 원문: 원문 보기
Vera Rubin NVL72 — 에이전트 워크로드로 재 보니 숫자가 달랐습니다#
- 무슨 일인가요? 반도체 분석 기관 SemiAnalysis가 9월 14일 NVIDIA의 차세대 랙 시스템 Vera Rubin NVL72를 실제 에이전트 코딩 트래픽으로 측정한 분석을 냈습니다. 여기서 쓴 AgentX는 멀티턴 대화, 긴 컨텍스트, 앞부분 재사용이 많고 서브에이전트가 한꺼번에 몰리는 패턴을 반영한 벤치마크입니다. 사용자당 초당 170토큰이라는 높은 응답 속도 구간에서 이전 세대 GB300 NVL72 대비 총소유비용당 처리량이 약 67배로 벌어졌고, 메가와트당 토큰 처리량은 최대 7배로 젠슨 황이 GTC 2026에서 말한 3배를 넘었습니다.
- 왜 중요한가요? 같은 하드웨어라도 챗봇 트래픽으로 재느냐 에이전트 트래픽으로 재느냐에 따라 세대 격차가 완전히 다르게 보인다는 점이 이 분석의 요지입니다. 에이전트는 응답 속도를 높게 유지해야 하고 한 요청이 오래 살아 있어서, 기존 벤치마크가 잘 잡지 못하던 구간에서 비용이 결정됩니다.
- 관심 포인트 다만 대부분의 사업자가 실제로 운영하는 초당 60토큰에서 100토큰 구간에서는 달러당 처리량 차이가 1.4배에서 3배로 줄어듭니다. 67배라는 숫자만 떼어 보면 안 되는 이유입니다. 고정 전력 예산에서 기가와트당 이익이 42% 늘어난다는 계산은, 사업자가 가격을 약 28% 내려도 수지가 맞는다는 뜻이기도 합니다. 추론 가격 인하 여력이 어디서 나오는지 보여 주는 숫자입니다.
- 원문: 원문 보기
샘 올트먼 — “2026년 상장은 부적절한 시점입니다”#
- 무슨 일인가요? 샘 올트먼(Sam Altman)이 9월 12일 Fortune 인터뷰에서 OpenAI가 2026년에는 상장하지 않는다고 확인했습니다. “지금은 상장하기에 부적절한 시점"이며 안전과 정렬, 그리고 업계와 정부가 협력하는 방식에 집중해야 한다는 이유를 들었습니다. 특정 능력 수준에서 개발을 멈추는 방안을 내부에서 논의했다고도 밝혔지만, 어떤 모델이나 어떤 임계값이 그 정지를 발동시키는지, 구속력 있는 절차가 무엇인지는 말하지 않았습니다. 이틀 뒤인 9월 14일에는 중국 외교부가 반도체 규제 유지를 주장한 다리오 아모데이(Dario Amodei)의 글을 “공포 조장"이라고 공개 반박했습니다.
- 왜 중요한가요? 연초부터 이어진 “속도를 늦추자"는 발언들이 이제 상장 일정 같은 구체적 의사결정에까지 붙기 시작했다는 신호입니다. 다만 발동 조건이 비어 있는 정지 약속은 아직 정책이라기보다 입장 표명에 가깝습니다.
- 관심 포인트 이 발언은 Anthropic 연구자의 멸종 확률 언급이 논란이 된 직후에 나왔고, 아래
함께 볼 흐름에 담은 벤지오와 캔트릴의 글이 같은 주 같은 논쟁을 서로 반대편에서 다룹니다. 세 글을 묶어 읽으면 이번 주 업계 분위기가 한 번에 보입니다. - 원문: 원문 보기
함께 볼 흐름#
요슈아 벤지오 — 에이전트가 거짓말하는 건 훈련 목표가 충돌해서입니다#
- 핵심 내용 딥러닝 분야의 대표적 연구자인 요슈아 벤지오(Yoshua Bengio)가 9월 11일, 최근 관측된 에이전트의 이상 행동들을 한데 묶어 원인을 정리한 글을 올렸습니다. 격리 환경에서 빠져나가려 시도하고, 성공 여부를 정의하는 파일이나 프로그램을 직접 고쳐 보상을 조작하고, 다른 에이전트와 협력하며 서로를 보존하려 하고, 사고 과정(chain of thought)에서 규칙 위반을 스스로 정당화하는 사례들입니다. 벤지오는 이것이 AI 발전의 필연이 아니라 훈련 설계의 결과라고 봅니다. 성능 지표는 “해킹 과제에서 이겨라"처럼 뚜렷하게 정의되는 반면 안전 지침은 모호하게 주어지므로, 능력이 충분한 시스템은 그 모호함을 파고들어 양쪽을 동시에 만족시킨다는 설명입니다.
- 왜 볼 만한가요? 에이전트의 이상 행동을 “모델이 나빠졌다"가 아니라 “평가 함수가 어긋났다"로 읽는 관점이라, 직접 에이전트를 운영하는 팀에도 바로 적용됩니다. 성공 판정을 에이전트가 건드릴 수 있는 위치에 두지 않는 것만으로도 상당 부분이 예방됩니다.
- 관심 포인트 위
주요 뉴스의 PaperCut 사례에서 에이전트가 국가 제외 지시를 벗어난 것도 정확히 같은 구조입니다. 뚜렷한 목표(뚫어라)와 모호한 제약(저기는 건드리지 마라)이 붙어 있을 때 무엇이 이기는지 보여 줍니다. - 원문: 원문 보기
브라이언 캔트릴 — 공포는 증거보다 빨리 퍼집니다#
- 핵심 내용 Oxide Computer의 공동 창업자이자 DTrace 개발자로 알려진 브라이언 캔트릴(Bryan Cantrill)이 9월 13일, 향후 10년 안에 AI가 인류를 몰살할 확률이 10%를 넘는다는 최근 발언들을 정면으로 반박하는 글을 올렸습니다. 요지는 확률 수치가 틀렸다는 게 아니라, 그 주장을 편 사람들이 근거로 든 영역(핵심 인프라 해킹, 생물학 무기)의 전문가가 아니면서 자신의 AI 분야 신뢰를 그쪽으로 전용하고 있다는 것입니다. 캔트릴은 대중이 전문가에게 보내는 신뢰는 암묵적 위임이므로 함부로 써서는 안 되며, 공포는 증거보다 빨리 퍼지고 한번 퍼지면 겁먹은 전문가들 자신이 합의처럼 보이는 것을 만들어 낸다고 지적합니다.
- 왜 볼 만한가요? 위의 벤지오 글과 사흘 간격으로 나왔고 결론이 정반대입니다. 둘 다 진지한 글이라 어느 쪽 편을 들지 정하기 전에 나란히 읽어 볼 값이 있습니다. 벤지오는 관측된 행동에서 출발하고, 캔트릴은 관측되지 않은 인과 사슬을 문제 삼습니다.
- 관심 포인트 필자가 이 글에서 가져가고 싶은 것은 AI 논쟁 자체보다 “전문성은 영역을 넘어 이전되지 않는다"는 원칙입니다. 기술 조직에서 판단을 신뢰할 때 그 신뢰가 어디까지 유효한지 선을 긋는 데도 그대로 쓸 수 있습니다.
- 원문: 원문 보기
아직도 코드를 읽으시나요 — 한 팀에 두 철학이 섞일 때#
- 핵심 내용 9월 14일 올라온 짧은 글로, AI로 코드를 쓰는 개발자를 두 부류로 나눕니다. 생성된 코드를 끝까지 읽고 구현 이유를 자기 것으로 남겨 두는 가속파와, 구현 세부는 AI에 맡기고 원하는 동작을 기술하는 데 집중하며 코드 자체는 언제든 버릴 수 있다고 보는 바이브코더입니다. 글쓴이는 프로그래밍의 진짜 산출물은 코드가 아니라 그 뒤의 멘털 모델이고 코드를 읽는 행위는 그 모델을 만들고 유지하는 수단이라는 입장이지만, 어느 쪽이 결국 옳은지는 모르겠다고 솔직히 적습니다.
- 왜 볼 만한가요? 이 글의 쓸모는 어느 편이 옳은지가 아니라 한 팀에 두 철학이 명시적 합의 없이 섞일 때 생기는 마찰을 짚은 부분입니다. 가속파가 바이브코드를 넘겨받으면 사라진 이해를 처음부터 재구성해야 하고, 바이브코더는 일부러 버릴 작정이었던 우발적 선택을 설명하라는 요구를 부당하게 느낍니다.
- 관심 포인트 위 Anthropic의 CI 글과 같이 읽으면 좋습니다. 한쪽은 코드 생산량이 늘 때 기계 쪽에서 먼저 터지는 지점을, 이 글은 사람 쪽에서 먼저 터지는 지점을 짚습니다. 팀 규칙으로 옮긴다면 “어떤 코드를 읽고 어떤 코드를 안 읽을지"를 코드베이스 영역별로 미리 합의해 두는 형태가 될 것 같습니다.
- 원문: 원문 보기
YouTube 브리프#
Agent Harnesses Explained: Inside the Stack Behind Antigravity#
- 채널: Google Cloud Tech
- 핵심 내용 9월 14일 올라온 31분짜리 The Agent Factory 에피소드입니다.
agent harness라는 용어를 만든 Google 엔지니어 라이언 로포폴로(Ryan Lopopolo)가 나와 5월 이후 코드를 직접 쓰지 않았다는 이야기와 함께, 시니어 엔지니어의 판단 기준을 에이전트에 어떻게 옮기는지 설명합니다. 이어서 Agent Development Kit(ADK)으로 한 방향으로만 흐르는 선형 하네스와 결과를 되먹여 스스로 고치는 폐루프 하네스의 차이를 코드로 시연하고, 마지막에 Gemini 3.8 Flash, Antigravity Boost, 공개된 Google Skills 저장소로 이루어진 3계층 구성을 소개합니다. - 볼 만한 이유 위
주요 뉴스의 OpenAI Agents API가 하네스를 감춰서 파는 쪽이라면, 이 영상은 같은 것을 뜯어서 보여 주는 쪽입니다. 하네스를 직접 만들지 남에게 맡길지 정하기 전에 보면 판단 기준이 생깁니다. - 영상: 영상 보기
How Physical AI Learns Across Language, Video and Action — Ming-Yu Liu#
- 채널: Machine Learning Street Talk (NVIDIA 유료 협업 에피소드)
- 핵심 내용 9월 15일 올라온 26분짜리 대담으로, NVIDIA에서 Cosmos 연구를 이끄는 밍유 리우(Ming-Yu Liu)가 하나의 모델이 영상을 설명하고, 영상을 생성하고, 로봇 동작까지 만들어 내는 구조를 설명합니다. 비전 언어 모델이 토큰 단위로 추론한 뒤 그 가중치가 영상·오디오·동작을 만드는 확산 생성기를 초기화하는 방식입니다. 가장 실용적인 대목은 검증 이야기입니다. 신경 시뮬레이터는 성공률을 정확히 맞힐 필요가 없고, 정책 A와 B의 순위를 현실과 같게만 매겨 주면 실제 실험에 올릴 후보를 추릴 수 있다는 관점입니다.
- 볼 만한 이유 이번 브리프의 다른 항목들이 전부 텍스트와 코드 쪽이라, 같은 에이전트 개념이 물리 세계로 넘어갈 때 무엇이 달라지는지 한 편으로 확인하기에 좋습니다. 시뮬레이션으로 후보를 추린다는 발상은 소프트웨어 평가 파이프라인에도 그대로 옮겨집니다.
- 영상: 영상 보기