updated
메타의 뮤즈는 어떻게 일을 대신할까
메타의 AI 모델 Muse Spark와 개인 비서 서비스 뮤즈는 어떻게 연결될까. 음원 수정 예시, 메일·사이트 제작 사용담, 안경 확장 계획을 통해 실제로 무엇을 하려는지 풀었다.

학교에서 보낸 준비물 목록을 바라보며 AI에게 필요한 물건을 찾아달라고 부탁한다. 휴대폰에 품목을 하나씩 옮겨 적거나 사진을 찍어 대화창에 올리는 대신, 안경을 쓴 채 이름을 부른다. 메타가 9월 23일 Connect에서 소개한 뮤즈의 다음 사용 장면이다. 안경 연동은 향후 몇 달 안에 제공한다는 계획이지, 발표 당일부터 모두 가능한 기능은 아니다. 메타의 Connect 발표와 공식 시연 안내.
이 소식만 보면 메타가 새 안경을 만든 이야기 같다. 다른 기사를 펼치면 뮤즈가 이메일을 읽고, 또 다른 발표에서는 음원을 손보거나 코드를 작성한다. 대체 뮤즈는 AI 모델일까, 앱일까, 기기일까. 이름이 비슷해 생기는 혼란 속에 이번 발표의 재미가 숨어 있다. 메타는 하나의 질문에 답하는 능력과, 그 답을 실제 일로 바꾸는 서비스와, 사람이 그 서비스를 부르는 자리를 함께 만들고 있다.
메타가 내세운 ‘개인 초지능’이라는 말은 크고 낯설다. 실제로 발표한 모델의 작업 예시와 뮤즈를 써본 사람들의 경험을 살펴보면, 그 안에서 무엇이 이미 작동하고 무엇이 아직 계획인지 좀 더 선명해진다.
뮤즈라는 이름 아래, 서로 다른 세 가지
먼저 Muse Spark는 AI 모델, Muse는 일을 맡기는 서비스로 나누면 이해하기 쉽다. 모델은 요청을 해석하고 다음 작업을 판단하는 핵심 기술이다. 서비스는 여기에 작업 공간과 도구, 계정 연결, 진행 기록 같은 기능을 붙여 사람이 사용할 수 있게 만든 제품이다. 안경은 그 서비스를 만나는 여러 입구 중 하나다. 모델을 안경에 넣었다는 말과 안경에서 서비스를 부를 수 있다는 말은 같은 뜻이 아니다.
현재 이야기의 배경이 된 모델은 9월 2일 발표된 Muse Spark 1.3이다. 메타는 이를 개발 도구인 Muse Code와 Meta Model API에 제공한다고 밝혔다. API는 다른 소프트웨어가 모델에 요청을 보내고 결과를 받는 통로다. Muse Code는 개발 작업을 위한 도구로, 일상 업무를 맡기는 소비자용 뮤즈와 구분된다. Muse Spark 1.3 공식 발표.
소비자 서비스 뮤즈의 발표는 그보다 뒤인 9월 8일이었다. 메타는 Muse Spark를 바탕으로, 전용 가상 컴퓨터와 브라우저에서 작업하는 개인 AI 에이전트라고 소개했다. 여기서 에이전트는 답변을 한 번 내고 끝내기보다 목표를 받아 여러 단계를 수행하는 시스템을 가리킨다. 앱이나 웹, WhatsApp에서 말을 걸고, 시간이 걸리는 일은 앱을 닫은 뒤에도 이어가도록 설계했다는 설명이다. 다만 모든 요청에 Spark 1.3 하나만 쓰인다고 발표한 것은 아니다. 뮤즈 서비스의 공식 소개.
Spark 1.3 발표에서 모델 가중치 공개는 앞으로의 계획에 들어 있다. 가중치는 모델이 학습한 수치들의 묶음이다. 모델을 내려받는 것과 완성된 비서 앱을 쓰는 것도 다르다. 모델이 공개되더라도 계정 연결과 승인 화면까지 자동으로 따라오는 것은 아니다.
개발 도구인 Muse Code에서도 쓰인다.
진행 기록을 보여주고 필요한 승인을 받는다.
결과를 받는 입구.
목소리로 일을 부탁한다.
노래를 고치되, 다른 악기는 건드리지 말 것
Spark 1.3의 공식 예시에는 음악도 있다. 지정된 베이스 기타 녹음의 오류를 고치되 다른 악기와 곡 길이는 유지하는 과업이다. 설명 대신 수정 파일을 만들어야 한다. 회사의 예시이며 메타투어가 품질을 재현한 결과는 아니다.
이런 부탁에는 바꿀 것과 남겨둘 것이 함께 있다. 잡음을 없애겠다고 한 구간을 통째로 잘라내면 악기들의 타이밍이 어긋날 수 있다. ‘수정했습니다’라는 답변보다 실제 파일이 약속을 지켰는지가 중요해진다.
메타는 긴 지시의 조건을 유지하고, 모호하면 되묻고, 막히면 도움을 요청하는 능력을 개선했다고 설명한다. 개발사의 주장인 이 설명과 음원 예시를 함께 보면, 목표가 단순히 빠른 문장 생성에 있지는 않음을 읽을 수 있다.
이를 생활 업무로 바꿔 생각해 보자. 다음은 기능 시연이 아니라 이해를 위한 가상 상황이다. 누군가에게 모임 장소를 알아봐 달라며 예산, 참석자 수, 이동 거리, 조용한 공간이라는 조건을 준다. 사진이 멋진 곳을 찾는 것만으로는 끝나지 않는다. 가격이 맞는데 예약이 안 될 수도 있고, 자리가 있는데 이동이 불편할 수도 있다. 조건 하나를 만족시킬 때마다 다른 조건을 버린다면 검색 결과는 많아져도 결정을 도와준 것은 아니다.
중간에 주최자가 참석자 한 명이 더 온다고 말하면 이미 찾은 후보도 다시 살펴야 한다. 그 말을 새로운 모임 요청으로 잘못 이해하지 않는 것, 최종 후보에서 바뀐 인원수를 잊지 않는 것, 불확실한 예약 가능 여부를 확인된 것처럼 쓰지 않는 것이 모두 한 작업에 포함된다. 모델의 긴 작업 능력이라는 낯선 표현은 이런 작은 약속을 여러 단계 뒤까지 지키는 능력으로 풀어볼 수 있다.
그렇다면 성능표를 보면 실제로 얼마나 잘할지 알 수 있을까. 메타의 평가 방법 문서는 문서 작성, 컴퓨터 조작, 웹 조사 등 서로 다른 시험을 구분하고 모델마다 설정과 실행 환경을 밝힌다. 타사 모델을 최적으로 조정한 환경은 아닐 수 있다는 한계도 적었다. 따라서 하나의 점수를 곧바로 ‘내 계정에서 모든 업무를 그만큼 성공한다’는 확률로 읽을 수는 없다. Muse Spark 1.3 평가 방법.
문서 시험에서 좋은 보고서를 만든 것과 실제 상대에게 올바른 메일을 보낸 것은 완료의 기준부터 다르다. 전자는 산출물의 내용을 평가할 수 있지만, 후자는 받는 사람과 첨부파일, 전송 시점까지 맞아야 한다. 좋은 모델을 갖췄더라도, 실제 발송까지 하려면 계정을 연결하고 행동을 확인하는 제품 설계가 더 필요하다. 뮤즈 같은 서비스의 역할이 여기서 시작된다.
읽지 않은 메일에서 답장 직전까지
추상적인 ‘대신 일하기’보다 작은 메일 한 통이 더 많은 것을 보여준다. 기술 매체 TechRadar에 기고하는 에릭 할 슈워츠는 9월 14일 사용기에서 이메일 접근을 허용한 뒤의 경험을 적었다. 뮤즈가 태양광 패널 점검과 관련해 전력회사에서 온 미확인 메일을 찾아냈고, 그가 방문 날짜를 고르자 답장 초안을 만들어 승인을 기다렸다는 내용이다. 한 기자의 초기 사용담이며 모든 계정에서 같은 결과가 난다는 검증은 아니다. 슈워츠의 직접 사용기.
이 장면의 변화는 답장 문장이 특별히 아름답다는 데 있지 않다. 사람이 메일함에서 원문을 찾아 복사하고, AI에 붙여 넣고, 답변을 다시 메일 창으로 옮기는 사이의 일이 줄었다는 데 있다. 다만 글쓰기만 부탁했을 때와 달리 AI가 자료를 가져올 수 있어야 한다. 슈워츠도 유용함과 함께 자신의 생활 정보를 맡기는 불편함을 기록했다. 편리함이 생긴 위치와 접근권이 넓어진 위치가 겹친 셈이다.
여기서 가상 컴퓨터라는 표현을 다시 볼 필요가 있다. 사용자의 휴대폰 속 작은 창이 일을 하는 전부라면 앱을 닫는 순간 작업이 끊기는 것으로 상상하기 쉽다. 메타가 설명한 구조에서는 뮤즈가 별도의 클라우드 작업 공간에서 브라우저와 도구를 사용한다. 휴대폰 앱은 부탁을 보내고 진행 상황을 확인하는 창이다. 사람으로 비유하면 메신저 대화창만 있는 것이 아니라, 업무를 할 책상도 따로 마련해 둔 모습에 가깝다.
물론 책상을 주었다고 내 서랍까지 저절로 열리는 것은 아니다. 어떤 자료에 접근하게 할지, 결과를 어디까지 바꾸게 할지 별도의 연결과 권한이 필요하다. 이메일에서 일정 후보를 읽는 것, 답장 초안을 만드는 것, 실제로 보내는 것은 겉보기에는 한 가지 부탁이어도 외부에 미치는 영향이 다르다. 초안은 고칠 수 있지만 발송한 말은 상대가 이미 읽었을 수 있다. 서비스가 이 경계를 어떻게 보여주는지가 모델의 문장 실력만큼 중요하다.
좋은 문장과 발송 허가는 별개의 문제다.
서비스의 완성도를 보려면 ‘끝났다고 말했다’와 ‘끝난 것을 확인했다’도 나눠야 한다. 초안이 만들어졌는지, 발송됐는지, 상대의 답을 기다리는지에 따라 사람의 다음 행동이 달라진다. 화면에 친절한 문장 하나만 남는다면 사용자는 다시 메일함을 열어 확인해야 한다. 맡긴 일이 늘어날수록 결과물뿐 아니라 현재 상태를 정확하게 보여주는 방식이 필요해진다.
사이트를 만들었다는 후기, 마지막 손질은 사람이 했다
메타의 제품 설계 글에는 뮤즈의 활동 기록, 목표를 추적하는 화면, 별도 주제 대화, 승인 화면이 소개돼 있다. 문서나 웹페이지처럼 꺼내 쓸 수 있는 결과물은 Artifacts라는 이름으로 부른다. 어려운 개념이라기보다 대화 속 설명을 실제 파일이나 화면으로 내어주는 방식이다. 글을 쓴 제품 제작자는 학교 이메일과 준비물을 챙기는 데 뮤즈를 활용했다고도 설명한다. 이 일화는 회사 내부의 자기보고이지 독립 사용기는 아니다. 메타 팀이 설명한 뮤즈의 제품 설계.
이 화면들이 필요한 이유는 일의 단위가 답변 한 개보다 길어졌기 때문이다. 여행 준비를 부탁했다면 정보가 가득한 긴 글보다 날짜별 일정표가 쓰기 좋을 수 있다. 수정할 때도 대화 전체를 뒤져 최신 답을 찾기보다 결과물을 열고 확인하는 편이 분명하다. 이는 뮤즈의 성공을 입증하는 평가라기보다, 발표된 제품 구조를 읽는 방법이다. 무엇을 생성하느냐와 사람이 그것을 다시 찾고 고칠 수 있느냐는 서로 다른 설계 문제다.
실제로 무엇을 만들었다는 초기 반응도 있다. 공개 Reddit 글에서 이용자 jinkstr86는 이틀 동안 Gmail과 웹사이트 제작 서비스 Squarespace를 연결해 블로그 페이지와 상품 판매 공간을 만드는 데 도움을 받았다고 썼다. 흥미로운 부분은 마지막 세부 손질은 직접 했다는 설명이다. 작업하는 모습을 볼 수 있고 필요하면 제어를 넘겨받을 수 있다는 점도 긍정적으로 평가했다. 사이트 작업을 맡겼다는 이용자의 원글.
빈 페이지에서 출발하는 부담을 줄여주는 것과 판매에 쓸 최종 페이지를 완성하는 것은 다른 일이다. 이 이용자는 초반 작업의 도움과 마지막 손질을 함께 경험했다. 그러니 이 글 하나를 완전 자동화의 성공담으로 읽거나, 전체 이용자의 만족도로 확대하기는 어렵다.
가령 상품 소개 페이지를 만든다고 생각해 보자. 설명용 가상 예시로, 제목과 사진 배치가 완성됐더라도 판매자가 약속하지 않은 배송 조건이 적혔다면 그대로 공개할 수 없다. 기능이 작동하는 것과 내 사업에 맞는 말인지 확인하는 것은 다른 판단이다. AI가 구조를 만들어 주면 시간을 아낄 수 있지만, 남은 손질의 성격에 따라 도움이 된 정도도 달라진다. ‘사람이 조금 고쳤다’는 문장을 실패율로 환산할 수 없는 이유다.
다른 공개 글의 작성자 TheRealJFranco는 하루 사용으로 이메일 확인과 게시글 초안 작업에 놀랐다고 쓰면서, 서비스를 더 연결하기 전에 어떤 안전 문제를 알아야 하는지 물었다. 댓글에는 이메일 접근 자체를 걱정하는 반응도 있었다. 9월 26일 확인한 제한된 공개 대화이므로 여론조사처럼 읽어서는 안 된다. 다만 기대와 경계가 같은 사람의 질문 안에 함께 있다는 점은 눈에 띈다. 이용 경험과 연결 권한을 함께 물은 공개 대화.
대신 일할수록, 멈출 자리를 정해야 한다
모델이 계속 똑똑해지면 이런 걱정도 저절로 해결될까. 메타의 보안 설계는 그렇게 가정하지 않는다. 회사는 작업하는 에이전트와 민감한 자격증명 보관 영역을 나누고, 외부 행동을 허용하는 별도 장치인 Sentinel을 두었다고 설명한다. 뮤즈가 어떤 행동을 제안하는 것과 그것을 실제로 허용하는 것을 분리한다는 뜻이다. 읽기와 쓰기도 연결 서비스가 지원하는 범위에서 나누며, 필요한 경우 사용자에게 별도 승인을 받는다고 밝혔다. 메타의 뮤즈 보안 설계 설명.
왜 일을 맡기는 AI에 별도의 승인 장치가 필요할까. 개발자 사이먼 윌리슨은 2025년 글에서 개인 자료에 접근하고, 믿을 수 없는 외부 내용을 읽고, 다시 외부로 정보를 보낼 수 있는 기능이 만날 때의 위험을 설명했다. 읽어온 문서 속 문장을 사용자의 진짜 명령처럼 받아들이면 자료 접근과 전송 능력이 엉뚱한 방향으로 연결될 수 있다는 문제다. 뮤즈에서 발생한 특정 사고를 분석한 글은 아니라 일반적인 배경이다. 윌리슨의 AI 에이전트 위험 구조 설명.
현재 제공되는 보호와 앞으로의 목표도 구분할 필요가 있다. 메타는 현행 가상 컴퓨터에 대한 직원 접근을 운영 정책으로 제한한다고 설명하면서도, 서비스 지원·보안·운영에 필요한 접근까지 기술적으로 모두 불가능한 것은 아니라고 밝혔다. 회사도 내용을 볼 수 없도록 하는 Confidential VM은 연말 제공을 목표로 한 별도 계획이다. ‘전용 공간’이라는 표현을 ‘메타조차 어떤 경우에도 접근할 수 없다’로 바꾸어 읽으면 아직 계획인 보호를 현재 기능으로 오해하게 된다.
사용자가 권한을 어떻게 이해했는지와 실제 동작이 어긋났다는 문제 제기도 있다. Inc의 기술 칼럼니스트 제이슨 에이튼은 9월 19일 자신의 메시지 내용이 뮤즈의 제안에 반영됐지만 그런 접근을 허용하지 않았다고 기억한다고 썼다. 글에는 필요한 설정을 사용자가 허용했다는 취지의 반론도 소개된다. 여기서는 원인과 재현 여부, 반론 원문 전체를 독립 확인하지 못했다. 따라서 무단 접근이 확정됐거나 모든 이용자의 메시지가 유출됐다고 확대할 사안은 아니다. 에이튼의 경험과 반론을 다룬 칼럼.
이 사례가 던지는 질문은 기술적 원인과 별도로 남는다. 서비스가 어떤 정보를 참고했는지 사용자가 납득할 수 있는가. 도움이 되는 제안이라도 전혀 예상하지 못한 사적 내용에서 나왔다면 편리함만으로 설명되지 않는다. 개인 비서라는 이름은 ‘나를 잘 안다’는 장점과 ‘어디까지 알고 있는가’라는 질문을 함께 가져온다. 모델의 답변 품질과는 다른 제품 신뢰의 문제다.
내 부탁을 받은 AI가, 모든 사이트의 손님은 아니다
한편 사용자가 허락해도 다른 회사가 그 접근을 받아들인다는 보장은 없다. 9월 20일 GeekWire는 아마존이 뮤즈의 쇼핑 접근을 차단했다고 보도했다. 기사에서 아마존은 에이전트가 자신을 알리지 않은 채 고객 계정과 구매 과정에 관여하는 점을 문제 삼았다. 메타는 해당 기사 시점에 문의에 즉시 답하지 않았다. 이것은 아마존의 입장과 차단 사실에 대한 보도이지, 뮤즈가 이용자 정보를 유출했다는 입증은 아니다. 아마존의 성명을 확인한 GeekWire 보도.
이 대목에서 모델의 능력, 사용자의 허가, 방문 사이트의 허용이라는 세 조건이 나뉜다. 화면을 읽고 상품을 찾을 줄 아는 능력이 있어도 사이트가 그 접근을 막으면 작업은 이어지지 않는다. 내가 내 계정에서 대신 움직여도 된다고 생각하는 것과, 판매자가 제삼자의 자동 접근을 받아들이는 것은 별개의 주장이다. 어느 쪽 법적 해석이 옳은지 이 글에서 판정할 문제는 아니지만, 소비자가 기대한 ‘알아서 구매’가 제품 성능만으로 정해지지 않는 이유는 분명해진다.
그래서 특정 사용기의 성공 장면을 현재의 모든 사이트에 그대로 적용하면 안 된다. 출시 직후 가능한 일이 이후 정책 변경으로 막힐 수도 있다. 모델의 버전이 바뀌지 않아도 서비스가 할 수 있는 일은 달라진다. AI가 브라우저를 조작할 수 있다는 설명을 인터넷 전체에 대한 통행증으로 받아들이지 않을 때, 제휴와 연결 기능에 관한 발표도 더 잘 이해할 수 있다.
이번 Connect에는 뮤즈 전용 이메일 주소와 Notion·GitHub·Box 등의 연결도 발표됐다. 모델을 더 똑똑하게 만드는 일과 별개로, 실제 작업이 이어질 길을 늘리는 소식으로 읽을 수 있다.
안경을 쓰면 달라지는 것은 ‘부탁의 출발점’
다시 준비물 목록으로 돌아가 보자. 안경은 눈앞의 상황을 문장으로 바꾸는 수고를 줄일 수 있다. 길게 생김새를 설명하는 대신 대상을 가리키는 식이다. 발표에서 읽을 수 있는 방향이지, 일상에서 정확성과 편의가 검증됐다는 결론은 아니다.
부탁의 출발점이 바뀌어도 그 뒤의 일은 남는다. 대상을 알아본 다음 어느 물건을 원하는지 파악하고, 필요한 자료를 찾고, 허용된 곳에 연결해, 결과를 전달해야 한다. ‘이것’이라는 말이 편리해질수록 그것이 무엇을 가리키는지 정확하게 확인하는 일도 중요해진다. 사람 사이에서도 같은 진열대를 보면서 서로 다른 물건을 가리킬 수 있다. 안경이라는 새 입구가 모델과 서비스 사이의 절차를 없애는 것은 아니다.
별도 기기 Muse Charm도 예고됐지만 자세한 정보는 연말에 공개할 예정이다. 지금은 구매 비교보다, 뮤즈를 여러 방식으로 부를 수 있게 하려는 시도에 주목할 단계다.
말하는 얼굴도 그중 하나다. 9월 23일 메타의 연구 발표는 실시간 음성 기술과 아바타 기술을 연결해 목소리와 입 모양·표정을 맞추는 방식을 소개했다. 이름은 Muse Realtime Voice와 Muse Realtime Avatar다. 공개된 기술 예시 전체가 소비자 앱에서 제공되는 아바타와 같지는 않다고 명시했다. 업무를 판단하는 모델과 말을 전달하는 얼굴을 같은 기능으로 취급하지 않아야 하는 이유다. 실시간 음성과 아바타의 공식 기술 설명.
화면 속 얼굴이 자연스럽게 움직이면 대화하기 편하게 느껴질 수 있다. 하지만 그 얼굴이 일정표를 정확하게 읽었는지, 답장을 올바른 사람에게 보낼지는 다른 기준으로 확인해야 한다. 목소리와 표정의 완성도는 소통의 경험을 바꾸고, 연결 도구와 승인 구조는 실제 일의 범위를 바꾼다. 모두 뮤즈라는 이름 아래 있어도 각각 좋아져야 하는 이유가 다르다.
지금 뮤즈에서 흥미로운 것은 안경 하나나 모델 버전 하나가 모든 일을 해결했다는 이야기가 아니다. 그 사이를 채우려는 시도가 구체적인 제품 형태를 얻었다는 점이다. 모델은 긴 부탁을 붙잡고, 서비스는 필요한 자료와 도구를 이어주고, 사람은 결과를 확인하며 다음 행동을 허락한다. 안경과 음성은 그 부탁을 꺼내는 순간을 일상 가까이 옮기려 한다. 메타가 바꾸려는 것은 답변이 표시되는 화면만이 아니라, 우리가 해야 할 일을 AI에게 넘기는 과정 전체다.