updated
AI가 다음 AI를 만든다는데, 지금 정말 어디까지 왔을까
코드 작성, 자동 실험, 연구 에이전트의 자기개선까지는 어디서 확인됐을까. 개발사 내부 자료와 독립 연구를 대조해, 아직 입증되지 않은 ‘완전한 AI 자기개선’과의 경계를 짚는다.

AI 연구 에이전트가 8일 동안 자기 프로그램을 고쳐 일곱 차례 개선된 버전을 골랐다는 논문이 2026년 9월 공개됐다. 제목에는 ‘재귀적 자기개선’이 붙었다. 하지만 에이전트가 고친 것은 자신을 움직이는 코드와 탐색 방식이다. 다음 세대의 기초 AI 모델을 스스로 훈련했다는 뜻은 아니다. 같은 ‘AI가 AI를 개선한다’는 말이 가리키는 두 장면 사이에는 큰 간격이 있다.
이미 연구실에서는 사람이 목표를 정하면 AI가 코드를 짜고 실험을 돌린다. 어떤 과제에서는 여러 에이전트가 가설과 결과를 주고받기도 한다. 그렇다면 AI가 바꾼 것은 연구자의 작업 시간인가, 실험용 코드인가, 에이전트 소프트웨어인가, 아니면 후속 기초모델 자체인가. 앤트로픽의 2026년 설명은 자사 AI 개발 업무의 일부가 자동화됐다고 말하면서도, 사람 없이 후속 모델을 설계하고 개발하는 완전한 자기개선에는 아직 이르지 않았다고 선을 긋는다. 이 글은 그 경계를 실제 사례를 따라 확인한다.
먼저, 연구실의 하루를 생각해보자
새 AI 모델을 만들려면 단순히 코드를 많이 쓰는 것으로 끝나지 않는다. 어떤 능력을 개선할지 고르고, 그 능력을 제대로 재는 시험을 만든다. 자료와 학습 방법을 정하고, 훈련용 프로그램을 작성해 컴퓨터에서 돌린다. 결과가 좋아 보여도 우연이나 측정 오류가 아닌지 확인해야 한다. 다른 능력이 나빠지거나 안전 문제가 생기지는 않았는지도 살핀다. 그다음에야 더 큰 모델에 적용할지, 다른 아이디어를 시험할지 사람이 결정한다. 이 과정의 어느 한 칸만 빨라져도 전체가 같은 비율로 빨라지는 것은 아니다.
가령 식당에서 주문을 받는 속도를 열 배로 높였다고 하자. 주방의 화구와 조리 인력, 완성된 음식을 확인하는 시간이 그대로라면 손님이 음식을 받는 시간은 열 배 빨라지지 않는다. AI 연구의 코드 작성과 실험 실행도 비슷하다. 잘 정의된 작업을 빠르게 처리하면 연구자는 더 많은 가설을 시험할 수 있지만, 무엇을 시험해야 하는지와 나온 답을 믿어도 되는지는 별도 문제다. 이 비유는 속도 병목을 설명하기 위한 것이지, 실제 연구실의 측정 결과는 아니다.
앤트로픽은 내부 AI 개발 업무를 크게 공학과 연구로 나눈다. 공학은 코드와 기반 시설, 모델 훈련 운영을 다룬다. 연구는 실험 방향을 정하고 결과를 해석하며 다음 아이디어를 고르는 일이다. 이 회사의 관찰에 따르면 Claude는 목표가 명확한 공학 업무와 실험 수행에서 빠르게 능력을 키웠다. 그러나 어떤 목표를 택할지 판단하는 단계에서는 여전히 큰 차이가 남아 있다고 한다. 앤트로픽이 공개한 내부 관찰은 자사 현장의 증언이지, 다른 연구소와 모든 업무에 그대로 적용되는 외부 검증 결과는 아니다.
연구실의 네 장면
어느 칸까지 AI가 맡았나
무엇을 개선할지, 성공을 무엇으로 잴지 정한다.
핵심 판단: 사람에이전트가 구현하고 반복 실행하는 사례가 있다.
자동화: 공개 사례 있음AI가 분석을 돕지만 점수의 의미와 오류를 따져야 한다.
최종 판단: 사람다음 기초모델을 스스로 설계·훈련·평가해 다시 반복하는 고리.
완전한 고리: 미입증코드가 여덟 배 늘었다는 말의 정확한 뜻
앤트로픽의 수치부터 보자. 회사는 2026년 5월 기준 자사 코드 저장소에 병합된 코드 줄의 80% 이상을 Claude가 작성한 것으로 귀속한다고 밝혔다. 같은 글에는 2026년 2분기 엔지니어 한 사람이 하루에 병합한 코드량이 2024년에 견줘 여덟 배라는 설명도 있다. 두 수치 모두 회사가 내부 코드를 어떤 방식으로 집계했는지에 의존한다. 특히 코드 여덟 배는 ‘연구 성과가 여덟 배’, ‘새 모델이 여덟 배 빨리 나온다’ 또는 ‘엔지니어 생산성이 여덟 배’라는 뜻이 아니다. 회사도 코드 줄 수는 양을 재는 불완전한 지표이고 실제 생산성 향상을 과장할 수 있다고 명시한다. 앤트로픽 원문을 읽을 때 이 단위를 떼어내면 숫자가 전혀 다른 뉴스가 된다.
그렇다고 이 변화가 단순한 숫자 놀음만은 아니다. 예전에는 AI가 짧은 코드 조각을 제안하면 사람이 옮겨 적었다. 지금의 에이전트는 파일을 고치고 프로그램을 실행하고 오류를 보고 다시 손볼 수 있다. 엔지니어는 방법을 줄마다 지시하기보다 목표를 주고 결과를 검토하는 쪽으로 움직인다. 이것이 같은 시간에 더 많은 시도를 열어주는 이유다. 동시에 AI가 작성한 변경을 사람이 이해하고 확인해야 하는 부담도 커진다. 코드가 밀려오면 검토 과정이 새 병목이 될 수 있다는 점도 앤트로픽이 스스로 적었다.
여기서 독자가 주목할 질문은 ‘AI가 코드를 썼나’에서 끝나지 않는다. 어떤 코드인가? 새 모델의 학습 과정에 쓰이는 것인가, 사내 도구를 고치는 것인가, 단순 정리 작업인가? 사람이 충분히 검토했는가? 고친 코드 때문에 모델 능력이 실제로 좋아졌는가? 병합된 줄 수만으로는 이 질문들에 답할 수 없다. AI가 AI 개발에 기여한다는 사실과, AI가 자신의 다음 버전을 통째로 만든다는 주장은 서로 다른 크기의 문장이다.
다른 개발사인 OpenAI도 비슷한 변화와 비슷한 경계를 공개했다. 이 회사는 2026년 9월 6일 사람이 잘 정의한 연구 업무를 맡기는 ‘자동 연구 인턴’이라는 목표에 도달했다고 자체 평가했다. 2028년 3월까지 더 넓은 ‘자동 AI 연구자’를 만들겠다는 것은 미래 목표다. 둘을 달성 사실 하나로 합치면 안 된다. OpenAI는 연구 우선순위를 정하고 어떤 아이디어를 계속할지, 모델을 확장하거나 멈추거나 배포할지는 여전히 사람이 결정한다고 밝혔다. OpenAI의 연구 현황 공개는 AI를 연구팀의 핵심 도구로 설명하지만 독립 연구소의 비교 실험은 아니다.
OpenAI가 내놓은 또 다른 수치는 2026년 8월 중순 연구 조직에서 사람의 한 근무일에 대응하는 에이전트 실행량이 3.1근무일이었다는 것이다. 여러 에이전트가 동시에 실행될 수 있고, 일부는 실패하거나 사람이 검토해야 한다. 따라서 ‘에이전트 3.1일’은 컴퓨팅 작업량의 단위이지 직원 한 명이 3.1배 생산적이라는 계산이 아니다. 회사는 연구자당 실험 건수가 증가했지만, 같은 기간 계산 자원도 크게 늘었다고 적었다. 어떤 상승분이 더 나은 AI 도구 덕분이고 어떤 상승분이 더 많은 컴퓨터 덕분인지 이 자료만으로 분리할 수 없다. 숫자는 변화의 방향을 알리는 신호지만 원인을 하나로 확정하지는 않는다.
사람이 고른 문제 안에서는 어디까지 할까
코드 작성보다 한 단계 넓은 일은 실험을 스스로 설계하고 되풀이하는 것이다. 앤트로픽 연구진은 약한 AI 모델이 더 강한 모델을 제대로 지도할 수 있는지 시험하는 과제를 골랐다. 문제 자체와 평가 기준은 사람이 정했다. 그 안에서 여러 Claude 기반 연구 에이전트가 가설을 내고 코드를 작성하고 실험하고 서로 발견을 공유했다. 2026년 4월에 공개된 실험 원문은 사람 연구자 두 명이 약 일주일 걸려 성능 격차의 23%를 회복한 반면, 에이전트 아홉 개는 병렬 작업의 누적 800시간과 약 1만 8000달러의 컴퓨팅·API 비용으로 97%를 회복했다고 보고한다.
97이라는 숫자가 23보다 크다고 ‘AI가 사람보다 네 배 이상 뛰어나다’고 말할 수는 없다. 사람 둘과 에이전트 아홉 개가 쓴 총 작업량, 병렬 실행, 비용이 같지 않다. 시험 환경에서 정답을 점수로 매길 수 있었고, 에이전트가 그 점수를 향해 계속 방법을 바꿀 수 있었던 것도 중요하다. 회사는 이 결과가 실제 대규모 모델에 깔끔하게 옮겨지지 않았다고 밝혔다. 더 큰 모델을 직접 훈련하는 전체 과정이 성공적으로 자동화됐다는 증거가 아니라, 사람이 잘 고른 연구 문제의 내부 실험을 에이전트가 깊게 밀어붙일 수 있음을 보여주는 사례다.
이 연구가 흥미로운 까닭은 ‘사람이 하나하나 시켰다’는 통념에도 잘 맞지 않기 때문이다. 큰 목표와 점수표를 받은 뒤에는 에이전트가 어떤 가설을 먼저 시험할지 스스로 고르고 실패를 반영했다. 사람의 역할은 매 실행의 버튼을 누르는 데보다, 좋은 질문을 만들고 시험의 경계를 정하는 데 있었다. 그러니 자동화의 진전도, 그 조건도 함께 봐야 한다. 점수로 잘 잴 수 없는 문제, 예컨대 어떤 새로운 연구 방향이 정말 가치 있는지 또는 뜻밖의 부작용을 어떻게 평가할지에 대해서는 같은 성과가 입증되지 않았다.
앤트로픽은 목표를 고르는 판단도 살피기 시작했다. 연구자와 Claude가 함께 조사하다가 사람이 돌아가는 길을 택한 세션 129개를 모았다. 우회 전 기록만 각 모델에 보여주고 다음 행동을 물었다. 세션의 결말을 본 다른 Claude가 사람과 AI 중 나은 제안을 골랐다. 회사 보고에서 AI의 제안이 사람의 선택보다 낫다는 판정 비율은 2025년 11월 모델의 51%에서 2026년 4월 모델의 64%로 올랐다. 앤트로픽의 방법 설명을 읽으면 이 숫자는 신중하게 해석해야 한다. 애초에 사람이 우회했음을 아는 사례만 골랐고, 심판도 다른 AI 모델이었다. 모든 연구 판단에서 AI가 사람보다 우월해졌다는 시험이 아니라, 사람이 막힌 일부 실제 순간에서 다음 경로를 찾는 능력이 개선됐다는 회사 내부 신호다.
이 사례는 왜 ‘다음 과제를 고르는 일’이 병목인지도 잘 보여준다. 코드를 빠르게 열 가지 만들어도 비교 시험이 잘못돼 있으면 틀린 답을 열 번 확인할 뿐이다. 반대로 사람이 잘못 택한 방향을 AI가 일찍 발견한다면, 코드량이 늘지 않아도 연구는 빨라질 수 있다. 지금의 공개 자료는 그런 가능성을 보여주지만, 연구 전체에 걸쳐 올바른 방향을 더 자주 택하는지까지 측정하지는 못한다. 어느 다음 단계를 고를지의 질과, 고른 단계를 얼마나 빨리 실행하는지는 별도 능력이다.
이번에는 에이전트가 자기 도구를 고쳤다
2026년 9월 22일 공개된 AIDE² 연구 논문은 한 걸음 더 나아간다. 연구 에이전트에게 자신의 작동 코드를 고치게 하고, 수정된 버전을 AI 연구 관련 과제로 시험해 점수가 나은 것을 다음 단계의 출발점으로 삼았다. 8일 동안 진행한 자율 실행에서 일곱 번의 연속 개선을 선택했다고 저자들은 보고했다. 별도로 남겨 둔 네 종류의 과제에서 개선이 일부 이어졌고, 저자들이 측정한 특정 보류 과제군에서는 점수를 편법으로 높이려는 행동도 줄었다. 숫자와 방법은 논문 저자의 보고이며, 이 글 작성 시점에 독립 재현 결과는 확인되지 않았다.
이 연구에 ‘재귀적 자기개선’이라는 이름이 붙은 이유는 이해할 만하다. 첫 버전의 에이전트가 자기 소프트웨어를 고쳐 둘째 버전을 만들고, 그 둘째 버전이 다시 같은 일을 맡는다. 개선된 도구가 다음 개선의 주체가 되는 짧은 고리다. 그러나 바뀐 대상은 모델의 기초 가중치 전체가 아니라 연구 에이전트의 코드와 탐색 방식이다. 사용된 기초 AI 모델 자체가 더 강한 차세대 범용 모델을 훈련하고, 그 모델이 다시 후속 모델을 만들어가는 장면은 아니다. ‘자기개선’이라는 같은 단어라도 무엇이 자신인지에 따라 의미가 달라진다.
논문이 남겨 둔 시험에서도 좋은 결과가 나왔다고 해서 실제 연구실 전체에 같은 개선이 퍼진다고 단정할 수 없다. 벤치마크는 연구 과제의 일부를 잘라낸 것이다. 평가 점수가 현장의 연구 방향 선택, 긴 훈련 과정의 안정성, 안전성 검토까지 대표하는지도 별도의 질문이다. 게다가 사전에 정한 시험에서 성능이 올라가는 것과 전혀 새로운 문제를 찾아내는 능력은 다르다. 이 실험은 ‘아무것도 안 됐다’가 아니라 ‘특정 에이전트 소프트웨어를 반복해서 개선하는 좁은 고리는 성공했다’는 정확한 위치에 놓여야 한다.
‘AI가 AI를 개선했다’의 목적어
이미 널리 관찰된다. 사람이 정한 문제의 구현·수정·실험을 AI가 맡는다.
제한된 반복 사례가 있다. AIDE²는 자기 코드·탐색 방식을 시험하며 일곱 차례 후속 버전을 선택했다.
완전 자율 고리는 미입증이다. 설계·훈련·평가·다음 방향 선택을 사람 없이 연속 수행해야 한다.
바깥에서 잰 속도는 무엇을 보여줄까
기업의 내부 숫자만으로 이 질문을 끝낼 수 없으니, 바깥의 측정도 보자. 비영리 연구단체 METR는 AI가 수행하는 과제의 ‘시간 지평’을 추적한다. 여기서 한 시간이란 AI가 실제 한 시간 동안 일했다는 뜻이 아니다. 사람이 과제를 끝내는 데 한 시간가량 걸리는 종류의 문제에서 AI가 얼마나 자주 성공하는지를 뜻한다. 50% 시간 지평이라면 해당 길이의 과제에 성공할 확률을 절반으로 예측하는 지점이다. METR의 방법 설명은 이 과제가 주로 답을 분명히 채점할 수 있는 소프트웨어 공학, 기계학습, 보안 문제라고 밝힌다. 현재 과제 묶음에서는 사람 기준 16시간을 넘는 추정치도 신뢰하기 어렵다고 경고한다.
앤트로픽은 이 시간 지평이 빠르게 늘어나는 추세를 근거로 미래에는 더 긴 연구 과제도 AI의 범위에 들어올 수 있다고 전망한다. 하지만 시험 과제의 성공률을 앞으로 연장한 예측과 실제 연구실에서 입증된 자율 업무는 구분해야 한다.
실제 개발 현장의 결과는 더 복잡하다. METR의 2025년 무작위 배정 실험에서 숙련 오픈소스 개발자 16명이 자신의 저장소에서 처리할 246개 업무를 AI 사용 허용과 비허용으로 나눠 수행했다. 당시 도구를 쓴 업무의 완료 시간은 오히려 19% 길었다. 이 결과를 ‘AI 코딩은 쓸모없다’로 일반화할 수 없다. 특정 개발자와 특정 프로젝트, 2025년 초 도구에 관한 연구이기 때문이다. 한편 2025년 하반기 새 도구로 진행한 후속 실험에 대해서는 METR 연구진 자신이 2026년 설명에서 참여자가 AI 없는 일을 꺼리는 선택 편향과 여러 에이전트의 시간을 재기 어려운 문제 때문에 최신 생산성 효과를 신뢰성 있게 추정하기 어렵다고 밝혔다.
내부 코드량은 늘고, 시험 문제 해결 능력도 좋아지는데, 현장 생산성은 환경에 따라 다르게 보인다. 서로 충돌하는 숫자를 억지로 하나의 평균으로 만들 필요가 없다. 무엇을 측정했는지가 다르기 때문이다. 코드의 양, 에이전트가 켜져 있던 시간, 시험에서 풀 수 있는 과제의 길이, 사람이 실제 업무를 끝내는 데 걸린 시간은 각자 다른 자를 댄 결과다. 회사 내부의 빠른 변화는 진짜일 수 있고, 특정 현장에서 AI 검토가 추가 작업을 낳은 것도 진짜일 수 있다. 아직 부족한 것은 이 다양한 장면을 연결해 ‘AI 덕분에 다음 범용 모델이 얼마만큼 더 빨리 발전했다’고 계산할 공통 측정법이다.
공개된 연구 기록에도 작은 연결고리가 있다. METR는 NanoGPT 훈련 속도 최적화 기록에서 2026년 4월까지 AI 에이전트의 기여가 명시된 최근 개선 네 건을 살폈다. 실제 개선 기록이라는 점은 의미가 있지만, 무엇을 사람이 지시했는지와 실패한 시도에 얼마를 썼는지는 기록만으로 알기 어렵다. 작은 규모의 공개 훈련 과제가 최첨단 기초모델 개발 전체와 같지도 않다. 이 사례는 ‘AI가 연구에 기여한 적은 없다’를 반박하지만, ‘AI가 연구를 통째로 인수했다’는 결론까지 밀어주지는 않는다.
빨라지는 연구와 스스로 가속하는 고리는 다르다
여기서 ‘재귀적’이라는 어려운 말을 풀어보자. 오늘의 AI가 다음 AI 개발을 돕고, 그렇게 만들어진 더 나은 AI가 그다음 개발을 더 잘 도우며, 이 과정이 이어지는 피드백을 뜻한다. 단지 개발자가 좋은 도구를 쓴 것만으로는 충분하지 않다. 첫 변화가 다음 변화의 원인이 되어야 하고, 그 효과가 비용과 새 병목을 넘어 지속되어야 한다. 한 번의 코드 최적화, 한 번의 에이전트 개선, 한 회사의 한 분기 코드 증가만으로는 이 고리의 강도를 알 수 없다.
경제학 연구자들이 2026년 9월 발표한 자기개선의 경제 모형 논문은 여러 피드백 경로를 따로 계산했다. AI가 AI 연구 시험에서 뛰어나는 능력과 사회의 다양한 유용한 일을 잘하는 능력도 구분한다. 저자들의 거친 추정은 현재 공개된 근거만으로는 자기유지적 가속이 시작될 만큼 피드백이 강하지 않지만, 그 강도가 커지고 있을 가능성은 있다는 것이다. 이것은 미래를 관찰한 결과가 아니라 가정과 제한적인 자료에 의존한 모형이다. 따라서 ‘폭발은 불가능하다’는 증명도, ‘곧 시작된다’는 날짜 예보도 아니다. 무엇을 더 측정해야 논쟁이 진전되는지 알려주는 반론에 가깝다.
가장 큰 질문 중 하나는 연구의 좋은 방향을 누가 고르느냐다. 지금 회사들은 AI가 실험을 실행하는 데서 속도를 얻는다. 앞으로 AI가 다음 실험의 가치와 실패 신호까지 신뢰성 있게 판단한다면 사람의 개입 지점은 더 좁아질 수 있다. 반대로 평가 점수만 높이는 방법을 잘 찾더라도 그 점수가 실제 진보와 어긋나면 시행착오를 빨리 늘리는 데 그칠 수도 있다. 대규모 훈련에 필요한 칩과 전력, 코드를 검토할 시간도 사라지지 않는다. 어느 조건이 결정적일지는 공개 근거로 아직 가를 수 없다.
이 때문에 다음 기사가 ‘AI가 또 스스로 개선됐다’고 말할 때는 네 가지를 보면 된다. 먼저 무엇을 고쳤는가. 실험 코드와 에이전트 도구인가, 아니면 후속 기초모델인가. 둘째, 목표와 시험을 누가 정했는가. 셋째, 점수가 오른 범위 밖에서도 결과가 유지됐는가. 넷째, 사람이 한 판단과 투입된 계산 비용을 포함해 같은 일을 다시 했을 때도 이득이 나는가. 이 질문은 회의적인 태도를 갖기 위한 체크리스트가 아니라, 서로 다른 성취를 제자리에 놓는 읽는 법이다.
2026년 9월 26일 현재 공개 자료가 보여주는 풍경은 분명하다. AI는 이미 AI 개발자의 일을 상당 부분 거들고, 잘 정해진 연구 문제에서는 계획과 실험을 상당 부분 이어간다. 자기 에이전트의 소프트웨어를 여러 번 고쳐 성능을 높였다는 초기 실험도 나왔다. 그러나 사람 없이 더 강한 범용 기초모델을 설계·훈련·평가하고, 그 모델이 다시 같은 과정을 이끄는 완전한 고리는 아직 공개적으로 입증되지 않았다. 흥미로운 변화는 이미 시작됐지만, 가장 큰 제목은 아직 미래형이다.
참고자료
- Anthropic Institute, When AI builds itself
- Anthropic Alignment, Automated Weak-to-Strong Researcher
- OpenAI, Research acceleration: The view inside OpenAI
- Srikanth et al., Recursive self-improvement of AI research agents
- METR, Task-Completion Time Horizons
- METR, Measuring the Impact of Early-2025 AI on Experienced Open-Source Developer Productivity
- METR, We are Changing our Developer Productivity Experiment Design
- METR, Evidence on AI R&D Progress from NanoGPT
- Cunningham et al., The Economics of Recursive Self-Improvement