What Our AI Agent Still Can't Do
개요
NoCoder의 AI 에이전트는 버그 수정 및 간단한 풀스택 빌드에서 높은 정확도를 보이지만, 복잡한 스캐폴딩, 런투런 일관성, 특정 유형의 작업에서는 여전히 한계점을 가지고 있습니다.
주요 내용
- AI 에이전트의 강점:
- 타겟 버그 수정: 실제 깨진 코드가 주어졌을 때, 컴파일되고 특정 변경사항을 적용하는 수정안을 생성합니다 (85-90% 정확도).
- 간단한 풀스택 빌드: 작동하는 SPA(Single Page Application)를 안정적으로 스캐폴딩하며, 프롬프트 입력부터 실시간 데이터베이스를 갖춘 풀스택 앱 빌드 및 배포까지 검증됩니다.
- AI 에이전트의 현재 한계점:
- 복잡한 풀스택 스캐폴딩: 인증 기능이 있는 노트 앱의 경우, 데이터베이스 스키마는 생성했지만 bcrypt / jsonwebtoken과 같은 빌드 실패를 유발할 수 있는 종속성을 누락했습니다.
- 런투런 일관성: 랜딩 페이지 기능의 개발 서버 점검이 한 번은 통과했지만 다른 한 번은 실패하는 등 비결정성이 관찰됩니다.
- 작은 정확도 실수: React.Fragment를 import 없이 사용하거나, 할 일 목록 앱에서 localStorage 지속성을 누락하는 등의 개별적으로는 사소하지만 프로덕션 환경에서는 발견되기 어려운 실수들이 발생합니다.
- 읽기 전용 작업: 단순히 정보를 찾아서 보고하는 작업에서도 파일을 작성하는 등, 행동해야 할 때와 하지 말아야 할 때를 구분하는 능력이 부족합니다.
- 개선 작업 및 투명성:
- 실패 분석 기반 개선 루프: 모든 실제 실패는 분석되어 프롬프트 변경 제안으로 이어지고, 프로덕션 배포 전에 회귀를 방지하는 홀드아웃 세트로 검증됩니다.
- 부분적 공개: 현재 일부 오류에 대한 수정이 진행 중이며, 일부는 아직 수정되지 않은 상태로 투명하게 공개합니다.
- 차이 검토(Diff Review) 중심: AI 에이전트의 불완전성을 인지하고, 모든 변경 사항은 배포 전 사용자가 승인하는 파일별 차이 검토를 통해 이루어집니다.
시사점
NoCoder의 AI 에이전트 한계점에 대한 투명한 공개는 사용자가 프로덕션 환경에서 예상치 못한 오류를 발견하기 전에 문제를 인지하고 대비할 수 있도록 하며, 차이 검토 중심의 개발 프로세스는 AI 속도로 개발하되 최종적인 통제권을 사용자에게 제공합니다.
원문을 불러오는 중...
댓글
GitHub Discussions