코딩 에이전트 도구 호출 검증 모델 'Gyra v0.2' 공개
코딩 에이전트의 파괴적 명령어 및 비밀 정보 노출을 제어하는 특화 모델. 에이전트 보안 파이프라인 구축 시 참고.
요약
Laya 영어 체크포인트를 파인튜닝하여 코딩 에이전트의 툴 호출을 제어하는 Gyra v0.2(421M) 모델이 공개되었습니다. 이 모델은 코딩 에이전트가 제안하는 명령어가 파괴적인 효과, 시스템 멈춤, 보안 노출을 유발하는지 판단하고 툴 출력물의 실패나 프롬프트 인젝션을 감지합니다. Claude Code 및 Codex와 연동할 수 있는 훅을 제공하며, 파일 접근 및 보안 위험에 대해 결정론적 규칙을 함께 적용합니다. 365개 사례를 대상으로 한 자체 감사 결과, 파괴적 명령 탐지(18/24), 멈춤 현상 감지(29/30), 보안 노출 탐지(7/12) 등에서 기존 Laya 모델보다 향상된 성능을 보였습니다. 다만 보안 노출 탐지 성능은 여전히 개선이 필요하며, 직접적인 파일 및 보안 위험은 별도의 고정 규칙을 통해 완벽하게 대응하고 있습니다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 I fine-tuned Laya for coding-agent tool calls: Gyra v0.2 (421M), with a model-only audit and Claude Code/Codex hook
원문 보기 ↗