아침에 건강 앱을 열었더니 수면 점수 82점이 떠 있다. 괜찮은 점수인지, 몸은 무거운데 앱을 믿어도 되는지 궁금해진다. 답은 어느 기기로 쟀는지에 따라 달라진다. 수면 점수는 체온처럼 모두가 같은 단위를 쓰는 측정값이 아니라, 회사마다 다른 재료와 공식으로 만든 종합 지표이기 때문이다.

이 글은 2026년 9월 30일 기준 Apple Watch, Google Health 앱(Fitbit·Pixel Watch), Garmin, Oura, 삼성 헬스의 공식 설명으로 점수의 재료와 등급 구간을 비교하고, 손목·손가락 기기가 잠을 얼마나 정확히 재는지 동료 심사 연구로 정리한다.

회사별 수면 점수 기준

서비스점수 재료(공식 설명)82점이 들어가는 구간
Apple Watch수면 시간 50점, 취침 시각 일관성 30점, 수면 중 깸 20점높음(81~95)
Google Health 앱(Fitbit·Pixel Watch)수면 시간, 안정된 잠(sound sleep)에 이르는 시간, 안정된 잠의 양, 뒤척임, 완전히 깬 횟수, 중단 시간을 나이·성별·잠자리 시간 목표와 비교좋음(80~89)
Garmin수면 시간, 얕은·깊은·렘수면 균형, 수면 중 평균 스트레스, 뒤척임·깬 시간, 심박 변이도좋음(80~89)
Oura총 수면, 효율, 뒤척임, 렘수면, 깊은 수면, 잠드는 시간, 수면 시각 7개 항목좋음(70~84)
삼성 헬스수면 단계별 시간과 수면 중 움직임(2022년 도움말 기준)공식 도움말에 숫자 구간 없음

Apple은 수면 점수를 수면 시간(50점), 취침 시각 일관성(30점), 수면 중 깸(20점)으로 계산하고, 0~40 매우 낮음, 41~60 낮음, 61~80 보통, 81~95 높음, 96 이상 매우 높음으로 나눈다. 취침 시각 일관성은 최근 13일 밤에 잠든 시각을 본다(Apple Watch 수면 점수 도움말). Google Health 앱은 90~100 매우 좋음, 80~89 좋음, 60~79 보통, 60 미만 나쁨으로 나누고, 수면 시간과 함께 안정된 잠에 이르기까지 걸린 시간, 흔들림 없이 이어진 안정된 잠의 양, 뒤척임, 다음 날 기억할 만한 완전한 깸, 깨어 있던 중단 시간을 나이·성별·잠자리에 있던 시간에 맞춘 목표와 비교한다. 같은 도움말은 대부분의 사용자 평균 점수가 72~83점 사이라고 적는다. 새 수면 점수 알고리즘으로 바뀐 뒤 점수가 달라질 수 있지만, 80점 이상이 좋은 점수라는 기준은 그대로라고 설명한다(Google Health 앱 수면 점수 도움말).

Garmin도 90~100 매우 좋음, 80~89 좋음, 60~79 보통, 60 미만 나쁨이다. 점수는 Firstbeat Analytics 기술로 얼마나 오래, 얼마나 잘 잤는지를 보고, 심박·심박 변이도·움직임 데이터를 쓴다(Garmin의 수면 점수 계산 설명). Oura는 85~100 최적, 70~84 좋음, 60~69 보통, 0~59 주의로 구간이 한 단계 낮게 잡혀 있다(Oura 수면 기여 요소 도움말). 2022년 7월 게시된 삼성전자서비스 도움말은 삼성 헬스가 수면 단계별 시간과 수면 중 움직임을 측정해 점수로 알려 주고 같은 연령대·전체 사용자와 비교해 보여 준다고 설명하지만, 숫자 구간은 싣지 않았다(삼성전자서비스 수면 측정 기능 안내).

그러니 82점은 네 회사 기준에서 모두 좋은 쪽 구간에 들지만, 같은 시험을 치른 82점은 아니다. Apple 점수의 절반은 수면 시간이고, Garmin은 수면 중 스트레스를 보고, Oura는 잠드는 시각까지 본다. 친구의 반지 점수와 내 시계 점수를 나란히 놓거나, 기기를 바꾼 전후 점수를 한 줄로 잇는 것은 의미가 약하다. 같은 회사 안에서도 Google처럼 점수 알고리즘을 바꾸면 숫자가 달라질 수 있어, 업데이트 전후도 따로 봐야 한다.

평균이 어디쯤인지 알려 주는 자료도 있다. Garmin은 2024년 2월 1일~2025년 1월 31일 지난 12개월 중 9개월 이상 수면을 기록한 사용자의 평균 수면 점수가 72였고, 평균이 ‘매우 좋음’인 사용자는 7%, ‘좋음’ 31%, ‘보통’ 43%, ‘나쁨’ 19%였다고 발표했다(Garmin 사용자 수면 데이터 발표). Garmin 기준 82점은 사용자 다수보다 높은 편에 속한다.

기기는 잠을 직접 보지 않고 추정한다

스마트워치와 스마트링은 뇌파를 읽지 않는다. Google 도움말은 기기가 움직임과 심박, 특히 심박의 미세한 변화(심박 변이도)로 잠든 시점과 수면 단계를 예측한다고 설명한다(Google Health 수면 단계 감지 도움말). 병원의 수면다원검사는 뇌파·눈 움직임·근육 활동·호흡 등을 함께 기록하는 기준 검사다. 손목 기기의 ‘깊은 수면 58분’은 58분을 셌다는 뜻이 아니라 그렇게 추정했다는 뜻이다.

그 추정이 얼마나 맞는지는 여러 연구가 쟀다. 2025년 Sleep Advances에 실린 벨기에 앤트워프대학병원 수면센터 연구는 수면무호흡이 의심되는 환자와 건강한 사람을 함께 모은 성인 62명(수면무호흡 없음 27명)이 수면다원검사를 받는 동안 여섯 종 기기(Fitbit Charge 5, Fitbit Sense, Withings ScanWatch, Garmin Vivosmart 4, Whoop 4.0, Apple Watch Series 8) 중 2~4개를 함께 차게 했다. 모든 기기가 실제 수면 구간의 91.7~96.3%를 수면으로 찾아냈지만, 실제로 깨어 있던 구간을 깨어 있음으로 맞힌 비율은 29.4~52.2%에 그쳤다. 수면 단계 일치도(카파)는 0.21~0.53이었다(Sleep Advances 2025, 손목 기기 6종 검증 연구).

이 숫자가 뜻하는 바는 분명하다. 기기는 잠을 놓치지는 않지만, 가만히 누워 깨어 있던 시간을 잠으로 세는 경향이 있다. 2021년 Sleep에 실린 미 해군 보건연구센터 연구도 건강한 젊은 성인 34명을 사흘 밤 재어 기기 7종(착용형 4종, 몸에 차지 않는 비착용형 3종)을 비교했다. 수면 탐지 민감도는 모두 0.93 이상이었지만 깨어 있음 탐지는 0.18~0.54였고, 잠이 끊긴 밤에는 성능이 더 나빠지는 경향을 보고했다(Chinoy 외, Sleep 2021).

2026년 5월 Behavioral Sleep Medicine에 실린 체계적 문헌고찰·메타분석은 건강한 성인 대상 연구 16편을 검토해 10편을 통합했다. 웨어러블은 총 수면 시간과 수면 효율을 높게, 잠든 뒤 깨어 있던 시간을 낮게 추정했고, 기기 사이 편차가 컸으며, 모든 지표에서 일관되게 앞선 기기는 없었다. 저자들은 전반적인 수면 지표는 합리적으로 추정하지만 단독 진단 도구나 세밀한 수면 단계 분석에 쓰기에는 한계가 있다고 결론지었다(Agostinho 외, Behavioral Sleep Medicine 2026).

이 연구들은 특정 세대 기기와 제한된 참가자를 대상으로 했다. 2021년 연구와 2026년 메타분석은 건강한 성인을, 2025년 연구는 수면무호흡 의심 환자가 섞인 수면센터 방문자를 살폈다. 오늘 판매되는 모든 모델과 모든 사람에게 같은 숫자를 옮길 수는 없다. 다만 방향은 연구마다 같다. 밤의 시작과 끝, 여러 날의 흐름은 비교적 잘 잡고, 깨어 있던 시간과 단계별 분량은 덜 정확하다. 깊은 수면이 58분에서 66분으로 늘었다고 회복이 그만큼 늘었다고 읽기는 어렵다.

점수보다 먼저 기록이 온전한지 본다

점수는 재료가 빠지면 흔들린다. Google은 밴드가 느슨하거나 심박을 꾸준히 잡지 못하는 자세로 잤거나 배터리가 매우 낮으면 수면 단계가 표시되지 않을 수 있고, 단계를 추정하려면 최소 20분의 수면 데이터가 필요하다고 안내한다. 손목뼈에서 손가락 두세 개 폭 위에 차라고 권한다(Google Health 수면 단계 감지 도움말). Oura는 앱과 동기화하지 않아 반지 메모리가 덮어쓰인 경우, 밤중 배터리 부족·방전, 3시간이 안 되는 수면, 심한 뒤척임, 미착용, 소프트웨어·하드웨어 문제를 데이터 공백의 원인으로 든다(Oura 수면 데이터 공백 도움말).

  • 밤 대부분 기기를 차고 있었고 느슨하지 않았는가
  • 앱의 잠든 시각·깬 시각이 기억과 크게 다르지 않은가
  • 심박 그래프에 설명되지 않는 긴 빈 구간이 없는가
  • 배터리 부족이나 동기화 실패 표시가 없었는가
  • 기기 교체, 앱 업데이트, 해외 이동, 야간 근무처럼 평소와 다른 조건이 있었는가

하나라도 크게 어긋난 밤은 좋은 밤이나 나쁜 밤이 아니라 비교에서 뺄 밤이다.

하루 점수보다 여러 밤의 흐름

82점이 좋은지는 내 평소 범위와도 관계가 있다. 늘 70점 안팎이던 사람에게는 오른 숫자이고, 늘 90점 안팎이던 사람에게는 내려온 숫자다. 여러 밤을 모아야 평소 범위가 보인다. 싱가포르 21~40세 직장인 1,041명의 Fitbit 기록 10만 7,144밤을 분석한 연구는 한 주 평균 수면 시간을 ‘좋은’ 신뢰도로 추정하려면 최소 3밤, ‘매우 좋은’ 신뢰도로는 5밤이 필요했고, 한 달 평균은 각각 5밤과 10밤이 필요했다고 보고했다. 수면 시간의 들쭉날쭉함을 한 달 단위로 보려면 11~18밤이 필요했다(Lau 외, Sleep Advances 2022). 특정 집단의 특정 기기 연구지만, 하루 점수보다 몇 주의 흐름이 더 믿을 만하다는 방향은 분명하다.

점수만 보지 말고 기기가 추정한 총 수면 시간도 같이 본다. 미국수면의학회(AASM)와 수면연구학회의 합의문은 성인이 규칙적으로 하룻밤 7시간 이상 자야 한다고 권고한다(AASM·SRS 성인 권장 수면 시간 합의문). 점수가 좋은 구간이어도 추정 수면 시간이 이보다 계속 짧다면 점수보다 그쪽이 먼저다. 미국 국립심폐혈액연구소(NHLBI)는 수면 문제를 살필 때 몇 주 동안 수면 일지를 써 보라고 안내한다(NHLBI 수면 부족 진단 안내, NHLBI 수면 일지). 앱 점수 옆에 아침의 개운함과 오후 졸림을 함께 적으면, 점수와 몸이 같은 방향으로 움직이는지 볼 수 있다.

점수에 끌려다니지 않으려면

점수를 올리려다 오히려 잠이 불편해지는 경우도 보고됐다. 2017년 Journal of Clinical Sleep Medicine에 실린 사례 보고는 수면 추적기 데이터에서 본 얕은 잠이나 뒤척임 때문에 스스로 불면이나 수면 부족을 진단하고 치료를 찾는 환자들을 다루며, 이상적인 잠을 좇는 완벽주의를 ‘오쏘솜니아(orthosomnia)’라 불렀다(Baron 외, Orthosomnia, J Clin Sleep Med 2017). 앱을 보기 전에 몸 상태를 먼저 적어 두면, 숫자가 기분을 먼저 정하는지 알아보기 쉽다.

점수가 좋아도 넘기지 말아야 할 신호

미국수면의학회는 소비자 수면 기기가 검증과 미국 식품의약국(FDA) 허가가 부족해 현재로서는 수면장애의 진단이나 치료에 쓸 수 없고, 적절한 임상 평가 안에서 환자와 의료진의 대화를 돕는 데 쓸 수 있다는 입장이다(AASM 소비자 수면 기술 입장문). 점수가 높다고 증상이 사라지지는 않는다.

NHLBI는 낮에 자주 졸리거나 개운하게 깨지 못하거나 교대 근무에 적응하기 어렵다면 의료진과 상의하라고 안내한다. 수면무호흡의 흔한 증상으로는 숨이 멈췄다 다시 쉬는 호흡, 잦고 큰 코골이, 숨을 헐떡이며 깨는 것, 낮 동안의 졸림과 피로를 든다. 잘 때 나타나는 증상은 누군가 알려 주기 전까지 모를 수 있다(NHLBI 수면 부족 진단 안내, NHLBI 수면무호흡 증상). 이런 신호가 있다면 점수와 상관없이 진료를 받는 것이 순서다.

82점은 대부분의 기준에서 괜찮은 숫자다. 다만 그 숫자는 어느 회사의 공식으로, 온전한 기록 위에서, 내 평소 범위와 비교해 읽을 때 뜻이 생긴다.

참고 자료18건