막은 것은 모델뿐이었다: IssueTrojanBench 코딩 에이전트 인젝션 리뷰
악성 이슈 66.5%가 코딩 에이전트 가드레일을 관통한 IssueTrojanBench를 원문 대조 — 거부의 82.9%가 모델 단독 방어였다는 구조를 검증하고 판단을 붙였습니다.
- 6개 에이전트-모델 쌍 4,176회 실행에서 악성 이슈 66.5%가 에이전트·LLM 가드레일을 모두 관통했습니다(Codex Desktop 79.2%, Cursor 66.5%, Claude Code 41.1%).
- 거부 1,400건 중 82.9%가 모델 수준 명시적 거부 — OS 샌드박스 등 프레임워크 방어는 관찰 가능한 거부에 기여하지 못했습니다.
- 언어·위치·표기 변형은 성공률에 영향이 없어 패턴 필터가 아니라 의미·출처 기반 방어가 필요하다고 판단했습니다.



