편집자 노트: 2026년 5월 11일 주간 AI 뉴스 — DeepMind의 AlphaEvolve가 알고리즘·수학·구글 인프라까지 실증적 성과를 내며 단일 코딩 에이전트의 활용 범위를 넓혔습니다.
필즈상 수상자 Tim Gowers가 ChatGPT 5.5 Pro로 박사급 조합론 결과를 1시간 만에 도출한 사례, MS의 DELEGATE-52 벤치마크가 드러낸 '문서 훼손' 한계, GPT-5.5 추론 노력 곡선의 비용·품질 트레이드오프까지 — 코딩 에이전트의 실제 능력과 한계를 동시에 짚어보는 한 주였습니다.

AI 모델 & 연구

AlphaEvolve: 여러 분야로 영향력을 확장하는 Gemini 기반 코딩 에이전트

GeekNews

  • DeepMind의 Gemini 기반 코딩 에이전트가 알고리즘 설계를 넘어 수학·과학·구글 인프라 최적화로 영역 확장
  • 게놈학 DeepConsensus 변이 검출 오류 30% 감소, 전력망 AC OPF 가용해 14% → 88% 이상, Willow 양자 프로세서 회로 오류율 10배 개선
  • Terence Tao와 함께 Erdős 문제 해결에 기여, TSP·Ramsey Number 한계 개선
  • TPU 설계, Spanner LSM-tree compaction, 컴파일러 최적화(저장공간 9% 절감)로 구글 내부 인프라에도 적용
  • Klarna 학습 속도 2배, FM Logistic 경로 효율 10.4% 개선, Schrödinger 분자 역장 학습/추론 4배 가속

ChatGPT 5.5 Pro를 최근 사용한 경험 (Tim Gowers, 박사급 조합론 1시간만에)

GeekNews

  • 필즈상 수상자 Tim Gowers가 ChatGPT 5.5 Pro로 약 1시간 만에 박사과정 수준 조합론 결과 도출
  • Nathanson 덧셈적 정수론 문제에서 17분 5초 만에 최적의 이차 상계 구성을 제시 — 기존 지수적 상계를 다항식 의존성으로 개선
  • h-dissociated 집합 기반 접근으로 기하급수열 구성을 대체하는 핵심 기법을 모델이 직접 생성
  • 출판 가능 수준이지만 인간 검증을 거친 별도 저장소가 필요할 수 있다는 지적과 함께, 박사 훈련 기준이 'LLM이 못하는 결과'에서 'LLM과 협업해 LLM 혼자 못하는 일을 증명'으로 이동할 가능성 제기

LLM은 위임할 때 문서를 훼손한다 (DELEGATE-52 벤치마크)

GeekNews

  • Microsoft가 코딩·음악·결정학 등 52개 전문 도메인에서 20단계 연속 편집 위임 시 문서 보존도를 평가하는 DELEGATE-52 공개
  • Gemini 3.1 Pro, Claude 4.6 Opus, GPT-5.4 등 최상위 모델이 워크플로 종료 시 평균 25% 문서 손상 — 손상은 누적적
  • 약한 모델은 콘텐츠 삭제, 프런티어 모델은 콘텐츠 왜곡 형태로 실패 — 에이전틱 도구 사용도 개선 효과 없음
  • microsoft/DELEGATE52 저장소·데이터셋 공개, 위임 워크플로 설계 시 명확한 한계 정량화

GPT-5.5 low vs medium vs high vs xhigh: 추론 곡선 26개 작업 결과

GeekNews

  • GPT-5.5 Codex의 4단계 추론 노력을 26개 실제 오픈소스 작업에 적용 — 테스트 통과율 low 21/26 → high 25/26 → xhigh 24/26
  • 인간 패치와의 의미적 동등성: 4 → 11 → 18 → 23, 코드 리뷰 통과율은 low 3/26 → xhigh 18/26
  • 비용 $2.65 → $9.77, 시간 287초 → 753초로 급증 — xhigh는 변경·픽스처가 커져 'footprint risk' 증가
  • 일상은 high 권장, 모호하거나 동시성 강한 작업에 xhigh 사용, 자체 하네스로 검증 필수

EMO: Pretraining mixture of experts for emergent modularity

Hugging Face

  • AllenAI가 사전 학습 단계에서 'emergent modularity'를 유도하는 MoE(전문가 혼합) 학습 방법 EMO 공개
  • 효율적 추론과 모듈성·라우팅 해석 가능성을 동시에 추구하는 시도로, 오픈모델 진영의 핵심 흐름을 보여 줌

Advancing voice intelligence with new models in the API

OpenAI

  • OpenAI API에 추론·번역·음성 인식이 가능한 새로운 실시간 음성 모델 추가
  • 더 자연스럽고 지능적인 음성 경험을 위한 멀티태스크 모델로, 음성 AI 인프라가 단일 통합 모델로 진화하는 흐름을 보여 줌

안전 & 해석 가능성

Running Codex safely at OpenAI

OpenAI

  • OpenAI가 Codex 코딩 에이전트를 사내에서 안전하게 운영하는 방식 공개
  • 샌드박싱·승인 워크플로·네트워크 정책·에이전트 네이티브 텔레메트리를 결합해 코딩 에이전트 도입의 보안·컴플라이언스를 지원

Introducing Trusted Contact in ChatGPT

OpenAI

  • ChatGPT가 심각한 자해 위험 신호를 감지하면 사전 지정한 신뢰 연락처에 알리는 안전 기능 도입
  • 옵션 기반으로 동작하며, 디지털 경고를 실제 도움 시스템과 연결하려는 시도

AI co-clinician으로 의료 모델 재설계

Google DeepMind

  • Google DeepMind가 AI 보조 임상의(co-clinician) 연구를 공개
  • AI 증강 진료 경로와 임상의 협업 모델을 탐색하며, 의료 분야에서 모델 신뢰성·임상 통합 방향성을 제시

도구 & 개발자

클로드 코드 사용하기: HTML의 놀라운 효율성

GeekNews

  • Claude Code에서 Markdown 대신 HTML로 출력하면 색상·다이어그램·SVG·JS 상호작용까지 풍부하게 표현 가능
  • 표·CSS·캔버스 활용으로 정보를 효율적으로 시각화하고, S3 등 링크로 공유하기 쉬워 실제 검토될 가능성도 높음
  • 활용처: 스펙·기획·탐색, 코드 리뷰·이해, 디자인 프로토타이핑, 리포트, 일회성 편집 UI
  • HTML 생성은 Markdown 대비 2~4배 시간이 걸리고 diff가 지저분해 버전 관리는 까다로움 — 슬라이더·버튼 등 인터랙티브 요소로 양방향 피드백 루프 구현 가능

CodeBurn - AI 코딩 도구 토큰 사용량/비용 추적 TUI 대시보드

GeekNews

  • Claude Code, Codex, Cursor 등 18개 AI 코딩 도구의 토큰·비용을 자동 추적하는 터미널 대시보드
  • 디스크에서 세션 데이터를 직접 읽어 API 키·래퍼 없이 LiteLLM 가격 데이터로 로컬 계산
  • optimize로 중복 파일 읽기·미사용 MCP·과도한 설정 등 낭비 패턴을 절감액과 함께 제시 — 설정 헬스 등급 A~F, compare로 모델 비교
  • yield로 AI 세션을 Git 커밋에 연결해 Productive/Reverted/Abandoned로 생산성 분류, macOS 메뉴바 앱·MIT 라이선스

Bun의 실험적 Rust 재작성판이 Linux x64 glibc에서 99.8% 테스트 호환성에 도달

GeekNews

  • Bun의 실험적 Rust 버전이 Linux x64 glibc에서 기존 테스트 99.8% 호환성 달성 — 약 96만 줄 재작성, 6일 만에 동작
  • Rust 컴파일러의 라이프타임 강제와 적시 destructor가 메모리 누수·크래시 문제를 줄여 줌
  • unsafe 블록이 명시적이라 자연스럽게 리팩터링 유도, 컴파일 속도는 Zig 버전과 비슷하거나 잠재적으로 더 빠름

Mojo 1.0 베타 — Python처럼 쓰고 C++처럼 실행

GeekNews

  • Modular의 Mojo 언어가 안정 버전 1.0.0b1에 도달 (5월 7일) — '파이썬처럼 쓰고 C++처럼 실행'
  • 네이티브 Python 상호운용성으로 병목만 점진적 마이그레이션, CPU와 동일 언어로 고성능 GPU 커널 작성 가능
  • 컴파일 타임 메타프로그래밍으로 하드웨어 특화 최적화·제로 코스트 추상화 — 컴파일러는 2026년 오픈소스 예정

OpenAI의 WebRTC 문제

GeekNews

  • WebRTC는 통화용으로 설계돼 나쁜 네트워크에서 패킷을 적극적으로 버리지만, 음성 AI는 정확한 프롬프트 전달이 더 중요
  • TTS는 클라이언트 버퍼링이 가능하지만 WebRTC는 도착 시간 기준 렌더링으로 인위적 지연 발생
  • ICE/DTLS/SCTP 핸드셰이크로 최소 8 RTT 필요 — 대안으로 WebSockets, QUIC/WebTransport(1 RTT)
  • 45+ RFC로 이루어진 WebRTC 표준의 한계가 프로토콜 포크를 강요하는 상황

ClojureScript에 Async/Await 도입

GeekNews

  • ClojureScript 1.12.145이 ^:async 힌트가 붙은 함수를 JS async 함수로 컴파일 — Promise를 await로 처리
  • 커뮤니티 설문에서 가장 우선순위 높은 JS 상호운용 개선 항목이었으며, 추가 의존성 없이 모던 브라우저 API 사용 가능

vLLM V0 to V1: Correctness Before Corrections in RL

Hugging Face

  • ServiceNow-AI가 vLLM V0→V1 마이그레이션에서 RL(강화학습) 학습 시 추론 결과 정확성 검증의 중요성을 강조
  • 보상 신호 오염을 막기 위한 운영 노하우 공유 — RL 파인튜닝 인프라 운영자 대상 실무 가이드

산업 & 정책

Meta의 AI 전환이 78,000명의 직원들을 고통스럽게 만들고 있다

GeekNews

  • Meta가 동의 없이 직원 컴퓨터 사용 데이터(키보드·마우스·클릭·화면)를 수집해 AI 모델 학습에 사용 — 옵트아웃 옵션 없음
  • AI 도구 사용량이 인사 평가에 반영되어 사내 경쟁 심화, 5월 20일 약 8,000명(전체 10%) 정리해고 예정
  • 'Transformation Weeks' 교육과 토큰 소비 추적 대시보드로 도구 채택을 강제, 직원들은 자기 후임 AI를 학습시켰다는 자조
  • Microsoft, Block, Coinbase 등 동시기 AI 관련 정리해고 발표 — 업계 전반의 신호

확률적 엔지니어링과 24/7 직원

GeekNews

  • 소프트웨어 개발이 결정론적 시스템에서 확률적 시스템으로 조용히 이동 중, 야간에 코드를 생성·리뷰·머지하는 AI 에이전트가 조직을 재편
  • 코드 생성 비용은 0에 수렴하지만 검증 비용은 높음(Jevons 역설) — 비대칭이 핵심
  • AI에 의존해 시작한 주니어는 디버깅·판단·장인성 훈련 위기, 항공·금융 같은 고위험 도메인은 결정론적, 소비자 SW는 확률적 속도로 양극화
  • '24/7 직원'은 인간 과로가 아니라 에이전트 함대의 병렬화 — 인간은 트리아지·필터·조율 역할

Higher usage limits for Claude and a compute deal with SpaceX

Anthropic

  • Anthropic이 Claude 사용량 한도를 상향 조정하고, SpaceX와 새로운 컴퓨트 파트너십 체결
  • 모델 학습·추론 인프라 확보 경쟁이 심화되는 가운데 위성 관련 기업과 손잡은 점이 시장에 신호를 줌

Hacker News

  • Google Chrome이 사용자 동의 없이 약 4GB 크기의 온디바이스 AI 모델(Gemini Nano 추정)을 설치한다는 프라이버시 이슈 제기
  • 디스크·대역폭·동의 측면에서 논쟁 확산 — 온디바이스 AI 보급에 따른 사용자 동의·자원 사용 이슈가 일반 사용자에게 직접적 파급

YouTube