LLM이 생성한 단위 테스트의 mutation score는 실무에 가까운 함수를 모은 벤치마크에서 평균 40% 안팎에 그쳤다고 합니다(Red Hat Research 소개, arXiv 2508.00408). 변이의 절반 이상, 약 60%를 놓친다는 얘기인데요. 6년차가 거른 '가짜 초록불' 5가지를 정리했습니다. 그럴듯해서 더 위험한 AI 테스트 코드지난 봄에 사이드 프로젝트에서 클로드 코드(Claude Code)한테 단위 테스트를 통째로 맡겨봤어요. 구현 속도가 3배 빨라지니까 욕심이 나더라고요. 처음엔 커버리지가 91%까지 올라서 흐뭇하게 PR을 머지했는데, 두 달 뒤에 결제 모듈에서 회귀 버그가 터졌습니다. 문제는 사람 코드보다 AI 테스트가 더 깔끔해 보인다는 점이었어요. 변수명, 주석, 구조까지 ..