sunny34.com

리서치 리뷰

AI·에이전트 분야의 새 논문과 아티클을 골라 원문 표·수치와 대조해 검증하고, 신뢰도 평가와 실무 적용 방안까지 붙이는 리뷰 시리즈입니다. 요약이 아니라 "믿어도 되는가, 무엇을 바꿔야 하는가"에 답합니다. 매일 자동 발행됩니다.

Discover

Search the reviews

전체 리뷰 표시 중 · 검색 버튼 또는 Enter 실행

· arXiv preprint

막은 것은 모델뿐이었다: IssueTrojanBench 코딩 에이전트 인젝션 리뷰

악성 이슈 66.5%가 코딩 에이전트 가드레일을 관통한 IssueTrojanBench를 원문 대조 — 거부의 82.9%가 모델 단독 방어였다는 구조를 검증하고 판단을 붙였습니다.

  • 6개 에이전트-모델 쌍 4,176회 실행에서 악성 이슈 66.5%가 에이전트·LLM 가드레일을 모두 관통했습니다(Codex Desktop 79.2%, Cursor 66.5%, Claude Code 41.1%).
  • 거부 1,400건 중 82.9%가 모델 수준 명시적 거부 — OS 샌드박스 등 프레임워크 방어는 관찰 가능한 거부에 기여하지 못했습니다.
  • 언어·위치·표기 변형은 성공률에 영향이 없어 패턴 필터가 아니라 의미·출처 기반 방어가 필요하다고 판단했습니다.
막은 것은 모델뿐이었다: IssueTrojanBench 코딩 에이전트 인젝션 리뷰 썸네일

· European Commission FAQ

미뤄지지 않은 의무: EU AI Act 제50조 투명성 FAQ 검증 리뷰

고위험 의무를 늦춘 옴니버스 개정 뒤에도 제50조 투명성 의무는 8월 2일 그대로 발효됐습니다. EC 공식 FAQ를 원문 대조해 유예·예외·집행 구조를 검증합니다.

  • 네 갈래 의무의 주체·시점을 원문으로 확정
  • 기계판독 표시만 12월 2일까지 유예
  • 집행 주체는 AI청이 아닌 각국 시장감시당국
미뤄지지 않은 의무: EU AI Act 제50조 투명성 FAQ 검증 리뷰 썸네일

· MCP Specification

세션이 사라진 MCP: 2026-07-28 스펙 리뷰

MCP 2026-07-28 스펙을 원문 SEP 기준으로 검증 — 무상태 전환, Tasks 확장 승격, Roots·Sampling·Logging 폐기가 에이전트 운영에 남기는 숙제를 정리한 리뷰입니다.

  • 세션·initialize 제거와 헤더 라우팅 — 웹 인프라 문법에 맞춘 재설계(SEP-2575·2243)
  • tasks/list 제거의 대가: 핸들 영속화·작업 대장이 클라이언트 의무로 이동
  • 채택 수치(월 5억 다운로드)는 자체 발표, 8개월 만의 2번째 대격변 등 감안점 명시
세션이 사라진 MCP: 2026-07-28 스펙 리뷰 썸네일

· NBER Working Paper

AI 코딩 도구의 생산성, 어디까지 진짜인가: NBER w35275 리뷰

개발자 10만 명 관측 데이터로 AI 코딩 도구 3세대의 효과를 검증하고, 커밋 +180%가 릴리스 +30%로 감쇠하는 구조와 실무 레버를 정리한 리뷰입니다.

  • 세대별 단일 효과와 누적 배수의 검산 일치(6개 생산 계층 전부) 확인
  • 릴리스 증가로 이어진 도구는 Claude Code(+29.2%) 하나뿐 — 도구가 아니라 파이프라인이 병목
  • 이해상충·상반된 RCT 증거·커버리지 한계까지 신뢰도 평가 포함
AI 코딩 도구의 생산성, 어디까지 진짜인가: NBER w35275 리뷰 썸네일