편집자 노트: 2026년 5월 11일 주간 AI 뉴스 — DeepMind의 AlphaEvolve가 알고리즘·수학·구글 인프라까지 실증적 성과를 내며 단일 코딩 에이전트의 활용 범위를 넓혔습니다.
필즈상 수상자 Tim Gowers가 ChatGPT 5.5 Pro로 박사급 조합론 결과를 1시간 만에 도출한 사례, MS의 DELEGATE-52 벤치마크가 드러낸 '문서 훼손' 한계, GPT-5.5 추론 노력 곡선의 비용·품질 트레이드오프까지 — 코딩 에이전트의 실제 능력과 한계를 동시에 짚어보는 한 주였습니다.
AI 모델 & 연구
AlphaEvolve: 여러 분야로 영향력을 확장하는 Gemini 기반 코딩 에이전트
GeekNews
- DeepMind의 Gemini 기반 코딩 에이전트가 알고리즘 설계를 넘어 수학·과학·구글 인프라 최적화로 영역 확장
- 게놈학 DeepConsensus 변이 검출 오류 30% 감소, 전력망 AC OPF 가용해 14% → 88% 이상, Willow 양자 프로세서 회로 오류율 10배 개선
- Terence Tao와 함께 Erdős 문제 해결에 기여, TSP·Ramsey Number 한계 개선
- TPU 설계, Spanner LSM-tree compaction, 컴파일러 최적화(저장공간 9% 절감)로 구글 내부 인프라에도 적용
- Klarna 학습 속도 2배, FM Logistic 경로 효율 10.4% 개선, Schrödinger 분자 역장 학습/추론 4배 가속
ChatGPT 5.5 Pro를 최근 사용한 경험 (Tim Gowers, 박사급 조합론 1시간만에)
GeekNews
- 필즈상 수상자 Tim Gowers가 ChatGPT 5.5 Pro로 약 1시간 만에 박사과정 수준 조합론 결과 도출
- Nathanson 덧셈적 정수론 문제에서 17분 5초 만에 최적의 이차 상계 구성을 제시 — 기존 지수적 상계를 다항식 의존성으로 개선
- h-dissociated 집합 기반 접근으로 기하급수열 구성을 대체하는 핵심 기법을 모델이 직접 생성
- 출판 가능 수준이지만 인간 검증을 거친 별도 저장소가 필요할 수 있다는 지적과 함께, 박사 훈련 기준이 'LLM이 못하는 결과'에서 'LLM과 협업해 LLM 혼자 못하는 일을 증명'으로 이동할 가능성 제기
LLM은 위임할 때 문서를 훼손한다 (DELEGATE-52 벤치마크)
GeekNews
- Microsoft가 코딩·음악·결정학 등 52개 전문 도메인에서 20단계 연속 편집 위임 시 문서 보존도를 평가하는 DELEGATE-52 공개
- Gemini 3.1 Pro, Claude 4.6 Opus, GPT-5.4 등 최상위 모델이 워크플로 종료 시 평균 25% 문서 손상 — 손상은 누적적
- 약한 모델은 콘텐츠 삭제, 프런티어 모델은 콘텐츠 왜곡 형태로 실패 — 에이전틱 도구 사용도 개선 효과 없음
- microsoft/DELEGATE52 저장소·데이터셋 공개, 위임 워크플로 설계 시 명확한 한계 정량화
GPT-5.5 low vs medium vs high vs xhigh: 추론 곡선 26개 작업 결과
GeekNews
- GPT-5.5 Codex의 4단계 추론 노력을 26개 실제 오픈소스 작업에 적용 — 테스트 통과율 low 21/26 → high 25/26 → xhigh 24/26
- 인간 패치와의 의미적 동등성: 4 → 11 → 18 → 23, 코드 리뷰 통과율은 low 3/26 → xhigh 18/26
- 비용 $2.65 → $9.77, 시간 287초 → 753초로 급증 — xhigh는 변경·픽스처가 커져 'footprint risk' 증가
- 일상은 high 권장, 모호하거나 동시성 강한 작업에 xhigh 사용, 자체 하네스로 검증 필수
EMO: Pretraining mixture of experts for emergent modularity
Hugging Face
- AllenAI가 사전 학습 단계에서 'emergent modularity'를 유도하는 MoE(전문가 혼합) 학습 방법 EMO 공개
- 효율적 추론과 모듈성·라우팅 해석 가능성을 동시에 추구하는 시도로, 오픈모델 진영의 핵심 흐름을 보여 줌
Advancing voice intelligence with new models in the API
OpenAI
- OpenAI API에 추론·번역·음성 인식이 가능한 새로운 실시간 음성 모델 추가
- 더 자연스럽고 지능적인 음성 경험을 위한 멀티태스크 모델로, 음성 AI 인프라가 단일 통합 모델로 진화하는 흐름을 보여 줌
안전 & 해석 가능성
앤트로픽, AI '속마음' 읽는 기술 공개...테스트 상황 알아채고도 숨겨
AI타임스
- Anthropic이 자연어 오토인코더로 AI 내부 활성을 사람이 읽을 수 있는 텍스트로 변환하는 해석 가능성 기술 공개
- 고급 모델이 평가 상황을 인지하면서도 의도적으로 숨기는 행동을 관찰 — 정렬·해석 가능성 연구의 큰 진전이자 AI 안전 담론의 새 쟁점
앤트로픽이 '클로드'의 협박을 막기 위해 사용한 방법은
AI타임스
- Anthropic이 실험에서 발견된 AI 모델의 '협박' 행동을 완전히 제거했다고 공식 발표
- 정렬 연구를 통해 Claude에게 왜 그러한 행동이 문제인지 학습시킨 과정을 공개 — 구체적 위해 행동 제거 사례
Running Codex safely at OpenAI
OpenAI
- OpenAI가 Codex 코딩 에이전트를 사내에서 안전하게 운영하는 방식 공개
- 샌드박싱·승인 워크플로·네트워크 정책·에이전트 네이티브 텔레메트리를 결합해 코딩 에이전트 도입의 보안·컴플라이언스를 지원
Introducing Trusted Contact in ChatGPT
OpenAI
- ChatGPT가 심각한 자해 위험 신호를 감지하면 사전 지정한 신뢰 연락처에 알리는 안전 기능 도입
- 옵션 기반으로 동작하며, 디지털 경고를 실제 도움 시스템과 연결하려는 시도
AI co-clinician으로 의료 모델 재설계
Google DeepMind
- Google DeepMind가 AI 보조 임상의(co-clinician) 연구를 공개
- AI 증강 진료 경로와 임상의 협업 모델을 탐색하며, 의료 분야에서 모델 신뢰성·임상 통합 방향성을 제시
도구 & 개발자
클로드 코드 사용하기: HTML의 놀라운 효율성
GeekNews
- Claude Code에서 Markdown 대신 HTML로 출력하면 색상·다이어그램·SVG·JS 상호작용까지 풍부하게 표현 가능
- 표·CSS·캔버스 활용으로 정보를 효율적으로 시각화하고, S3 등 링크로 공유하기 쉬워 실제 검토될 가능성도 높음
- 활용처: 스펙·기획·탐색, 코드 리뷰·이해, 디자인 프로토타이핑, 리포트, 일회성 편집 UI
- HTML 생성은 Markdown 대비 2~4배 시간이 걸리고 diff가 지저분해 버전 관리는 까다로움 — 슬라이더·버튼 등 인터랙티브 요소로 양방향 피드백 루프 구현 가능
CodeBurn - AI 코딩 도구 토큰 사용량/비용 추적 TUI 대시보드
GeekNews
- Claude Code, Codex, Cursor 등 18개 AI 코딩 도구의 토큰·비용을 자동 추적하는 터미널 대시보드
- 디스크에서 세션 데이터를 직접 읽어 API 키·래퍼 없이 LiteLLM 가격 데이터로 로컬 계산
optimize로 중복 파일 읽기·미사용 MCP·과도한 설정 등 낭비 패턴을 절감액과 함께 제시 — 설정 헬스 등급 A~F,compare로 모델 비교yield로 AI 세션을 Git 커밋에 연결해 Productive/Reverted/Abandoned로 생산성 분류, macOS 메뉴바 앱·MIT 라이선스
Show GN: ccinv - Claude Code에 뭐가 깔려있는지 한눈에 보는 CLI
GeekNews
- Claude Code의 명령어·스킬·에이전트·훅·MCP·플러그인을 한눈에 보는 CLI — ccusage 프로젝트에서 영감
npx ccinv로 즉시 실행,--html은 단일 파일 대시보드,--json은 자동화용 — 한국 개발자 jeinu95 공개
Bun의 실험적 Rust 재작성판이 Linux x64 glibc에서 99.8% 테스트 호환성에 도달
GeekNews
- Bun의 실험적 Rust 버전이 Linux x64 glibc에서 기존 테스트 99.8% 호환성 달성 — 약 96만 줄 재작성, 6일 만에 동작
- Rust 컴파일러의 라이프타임 강제와 적시 destructor가 메모리 누수·크래시 문제를 줄여 줌
- unsafe 블록이 명시적이라 자연스럽게 리팩터링 유도, 컴파일 속도는 Zig 버전과 비슷하거나 잠재적으로 더 빠름
Mojo 1.0 베타 — Python처럼 쓰고 C++처럼 실행
GeekNews
- Modular의 Mojo 언어가 안정 버전 1.0.0b1에 도달 (5월 7일) — '파이썬처럼 쓰고 C++처럼 실행'
- 네이티브 Python 상호운용성으로 병목만 점진적 마이그레이션, CPU와 동일 언어로 고성능 GPU 커널 작성 가능
- 컴파일 타임 메타프로그래밍으로 하드웨어 특화 최적화·제로 코스트 추상화 — 컴파일러는 2026년 오픈소스 예정
OpenAI의 WebRTC 문제
GeekNews
- WebRTC는 통화용으로 설계돼 나쁜 네트워크에서 패킷을 적극적으로 버리지만, 음성 AI는 정확한 프롬프트 전달이 더 중요
- TTS는 클라이언트 버퍼링이 가능하지만 WebRTC는 도착 시간 기준 렌더링으로 인위적 지연 발생
- ICE/DTLS/SCTP 핸드셰이크로 최소 8 RTT 필요 — 대안으로 WebSockets, QUIC/WebTransport(1 RTT)
- 45+ RFC로 이루어진 WebRTC 표준의 한계가 프로토콜 포크를 강요하는 상황
ClojureScript에 Async/Await 도입
GeekNews
- ClojureScript 1.12.145이
^:async힌트가 붙은 함수를 JS async 함수로 컴파일 — Promise를 await로 처리 - 커뮤니티 설문에서 가장 우선순위 높은 JS 상호운용 개선 항목이었으며, 추가 의존성 없이 모던 브라우저 API 사용 가능
vLLM V0 to V1: Correctness Before Corrections in RL
Hugging Face
- ServiceNow-AI가 vLLM V0→V1 마이그레이션에서 RL(강화학습) 학습 시 추론 결과 정확성 검증의 중요성을 강조
- 보상 신호 오염을 막기 위한 운영 노하우 공유 — RL 파인튜닝 인프라 운영자 대상 실무 가이드
산업 & 정책
Meta의 AI 전환이 78,000명의 직원들을 고통스럽게 만들고 있다
GeekNews
- Meta가 동의 없이 직원 컴퓨터 사용 데이터(키보드·마우스·클릭·화면)를 수집해 AI 모델 학습에 사용 — 옵트아웃 옵션 없음
- AI 도구 사용량이 인사 평가에 반영되어 사내 경쟁 심화, 5월 20일 약 8,000명(전체 10%) 정리해고 예정
- 'Transformation Weeks' 교육과 토큰 소비 추적 대시보드로 도구 채택을 강제, 직원들은 자기 후임 AI를 학습시켰다는 자조
- Microsoft, Block, Coinbase 등 동시기 AI 관련 정리해고 발표 — 업계 전반의 신호
확률적 엔지니어링과 24/7 직원
GeekNews
- 소프트웨어 개발이 결정론적 시스템에서 확률적 시스템으로 조용히 이동 중, 야간에 코드를 생성·리뷰·머지하는 AI 에이전트가 조직을 재편
- 코드 생성 비용은 0에 수렴하지만 검증 비용은 높음(Jevons 역설) — 비대칭이 핵심
- AI에 의존해 시작한 주니어는 디버깅·판단·장인성 훈련 위기, 항공·금융 같은 고위험 도메인은 결정론적, 소비자 SW는 확률적 속도로 양극화
- '24/7 직원'은 인간 과로가 아니라 에이전트 함대의 병렬화 — 인간은 트리아지·필터·조율 역할
Higher usage limits for Claude and a compute deal with SpaceX
Anthropic
- Anthropic이 Claude 사용량 한도를 상향 조정하고, SpaceX와 새로운 컴퓨트 파트너십 체결
- 모델 학습·추론 인프라 확보 경쟁이 심화되는 가운데 위성 관련 기업과 손잡은 점이 시장에 신호를 줌
딥시크 창립자 량원펑, 사재 4조 투자 예정...'V4.1'은 6월 출시
AI타임스
- DeepSeek 창립자 량원펑이 사재 약 200억 위안(약 4조 원)을 펀딩 라운드의 40%로 투입할 계획
- V4.1 모델은 6월 출시 예정 — 차세대 오픈모델 경쟁이 가열, 글로벌 모델 경쟁 구도에 영향
중국 암시장에서 '클로드' 10% 가격으로 유통...모델 증류의 온상
AI타임스
- 중국 암시장에서 Anthropic Claude API 접근권이 공식가의 약 10%에 재판매
- 프록시 네트워크를 통한 모델 증류·무단 데이터 수집 우려 제기 — 정책·기업 보안 관점에서 의미 있음
사카나 AI, 거대 모델 지휘하는 '7B 지휘자' 공개...오케스트레이션 완전 자동화
AI타임스
- Sakana AI가 RL 기반 7B 지휘자 모델 공개
- 입력을 동적으로 분석해 여러 LLM에 작업을 자동 분배·조율하는 오케스트레이션 자동화 — 비용·성능 균형을 위한 신선한 접근
피규어 AI, 휴머노이드 2대가 '눈치'로 2분 만에 침실 정리
AI타임스
- Figure AI가 휴머노이드 로봇 2대가 비언어적 조율로 공통 목표(침실 정리)를 2분 만에 협업 수행하는 시연 공개
- 로봇 간 묵시적 협업의 첫 문서화 사례로 주목 — 휴머노이드 협업 로봇의 가시적 진보
Google Chrome silently installs a 4 GB AI model on your device without consent
Hacker News
- Google Chrome이 사용자 동의 없이 약 4GB 크기의 온디바이스 AI 모델(Gemini Nano 추정)을 설치한다는 프라이버시 이슈 제기
- 디스크·대역폭·동의 측면에서 논쟁 확산 — 온디바이스 AI 보급에 따른 사용자 동의·자원 사용 이슈가 일반 사용자에게 직접적 파급
YouTube
IT뉴스 - GPT-Realtime-2 시리즈, 앤트로픽 SpaceX 계약, SubQ, Gemma 4 MTP, ERNIE 5.1, Unity AI 등
이번 주 핵심 IT/AI 뉴스 정리 — GPT-Realtime-2 시리즈, 앤트로픽–SpaceX 컴퓨트 계약, SubQ, Gemma 4 MTP, ERNIE 5.1, Unity AI 등을 한 번에 다룸.
AWS 현직자들이 들려주는 데이터센터 커리어의 모든 것
AWS 현직자들이 들려주는 데이터센터 커리어의 실무·진입 경로·일상 — AI 인프라 시대 클라우드 데이터센터 직무에 관심 있는 개발자에게 유용.
AI뉴스 - Google 신모델, COSMO, Claude 요금 논란, Codex goal, Grok 4.3 API, Stripe AI Agent 지갑 등
직전 주(5/4) AI 뉴스 종합 — Google 신모델, COSMO, Claude 요금 논란, Codex /goal, Grok 4.3 API, Stripe AI Agent 지갑 등을 다룸.