01 AI의 큰 그림·17 min read

머신러닝이란 무엇인가AI가 데이터에서 규칙을 배우는 방법

스팸 필터와 추천 시스템은 사람이 모든 판단 규칙을 입력하지 않아도 어떻게 결과를 만들까요? 머신러닝은 데이터에서 유용한 관계를 찾도록 모델을 훈련하고, 그 모델을 새로운 입력에 적용하는 방법입니다. 데이터·특징·정답·모델·학습·추론의 관계부터 지도학습·비지도학습·자기지도학습·강화학습, 과적합과 데이터의 한계까지 쉽게 설명합니다.

여러 형태의 데이터가 학습 과정을 거쳐 모델이 되고 새로운 입력을 예측하는 머신러닝 흐름을 보여주는 어두운 편집형 이미지
머신러닝은 사람이 모든 규칙을 직접 쓰는 대신, 데이터에서 조정한 모델을 이용해 새로운 입력에 대한 예측을 만든다. · DECHIVE

안녕하세요, DECHIVE입니다.

이메일 서비스는 수많은 메일 가운데 스팸을 골라냅니다. 쇼핑몰은 처음 보는 상품 중에서 내가 좋아할 만한 것을 추천하고, 내비게이션은 현재 상황을 바탕으로 도착 시간을 예상합니다.

이런 기능을 사람이 전부 규칙으로 작성하려면 어떻게 해야 할까요?

‘무료’라는 단어가 있으면 스팸, ‘할인’이 있으면 스팸이 아닌 메일처럼 조건을 하나씩 정할 수도 있습니다. 하지만 표현 방식이 조금만 바뀌어도 규칙은 금세 복잡해지고, 예외는 계속 늘어납니다.

머신러닝은 이 문제를 다른 방식으로 풀려고 합니다.

사람이 모든 판단 규칙을 직접 쓰는 대신, 여러 사례를 보여주고 그 안에서 결과를 만드는 데 유용한 관계를 찾도록 모델을 훈련합니다.

이번 글에서 답하려는 질문은 이것입니다.

머신러닝이 데이터에서 규칙을 배운다는 말은 정확히 무엇이며, 그렇게 만들어진 모델은 어떻게 새로운 입력에 답할까요?

머신러닝을 한 문장으로 설명한다면

머신러닝은 다음과 같이 정리할 수 있습니다.

머신러닝은 데이터를 이용해 모델의 매개변수를 조정하고, 새로운 입력에서 유용한 예측·분류·추천·콘텐츠를 만들도록 하는 AI의 주요 접근법입니다.

Google의 머신러닝 교육 자료도 머신러닝을 데이터로부터 유용한 예측을 하거나 콘텐츠를 생성하도록 모델이라는 소프트웨어를 훈련하는 과정으로 설명합니다. (Google for Developers)

여기서 가장 중요한 말은 데이터, 모델, 훈련, 그리고 새로운 입력입니다.

머신러닝은 데이터를 저장해두었다가 똑같이 꺼내는 것만을 뜻하지 않습니다. 과거의 사례에서 관계를 찾고, 학습할 때 보지 못했던 입력에도 그 관계를 적용할 수 있어야 합니다.

이 능력을 일반화(Generalization)라고 합니다.

훈련 데이터에서는 답을 잘 맞히지만 새로운 데이터에서는 성능이 크게 떨어진다면, 제대로 일반화했다고 보기 어렵습니다.

‘기계가 배운다’는 말은 비유입니다

머신러닝이라는 이름 때문에 컴퓨터가 사람처럼 경험을 이해하고 스스로 깨달음을 얻는 모습을 떠올리기 쉽습니다.

하지만 기술적으로 말하는 학습은 조금 다릅니다.

머신러닝 모델에는 결과를 계산하는 데 사용되는 여러 값이 있습니다. 이를 매개변수(Parameter)라고 합니다. 간단한 선형 모델에서는 기울기와 절편 같은 값이 매개변수가 되고, 신경망에서는 층과 층 사이의 수많은 가중치가 매개변수가 됩니다.

많은 머신러닝 모델은 학습 목표를 수치로 나타낸 목적 함수를 최적화합니다. 지도학습에서는 흔히 모델의 예측과 정답의 차이를 손실로 계산하고, 그 손실이 줄어드는 방향으로 매개변수를 조정합니다.

이 과정을 반복하면서 모델은 데이터에 들어 있는 관계를 수학적인 형태로 담게 됩니다.

Google의 선형회귀 교육 자료에서도 훈련 중 모델이 예측값과 실제값의 차이를 줄이도록 가중치와 편향을 조정한다고 설명합니다. (Google Machine Learning Crash Course)

따라서 “기계가 규칙을 배운다”는 표현은 이해를 돕는 말입니다.

대부분의 머신러닝 모델이 다음과 같은 문장을 직접 작성하는 것은 아닙니다.

‘이 단어가 세 번 나오고 발신 주소가 수상하면 스팸으로 분류한다.’

대신 입력의 여러 특징과 결과 사이의 통계적 관계가 모델의 매개변수에 반영됩니다. 모델이 복잡해질수록 그 관계는 사람이 한눈에 읽을 수 있는 규칙과는 더 멀어질 수 있습니다.

일반 프로그램과 무엇이 다를까요?

전통적인 프로그램은 보통 사람이 규칙을 정하고, 컴퓨터가 그 규칙을 입력값에 적용해 결과를 만듭니다.

예를 들어 쇼핑몰에서 구매 금액이 5만 원 이상이면 배송비를 무료로 만드는 기능은 다음처럼 표현할 수 있습니다.

구매 금액이 50,000원 이상이면
배송비는 0원

입력값과 규칙이 같으면 결과도 정해져 있습니다. 조건이 명확하고 예외가 적다면 이런 방식이 단순하고 안정적입니다.

머신러닝에서는 흐름이 달라집니다.

스팸 메일을 분류한다고 가정해보겠습니다. 개발자는 스팸을 구별하는 모든 문장 규칙을 직접 작성하는 대신, 스팸과 정상 메일의 사례를 준비할 수 있습니다. 모델은 단어, 발신자 정보, 링크 형태, 문장 구조 같은 입력 특징과 정답 사이의 관계를 학습합니다.

훈련이 끝난 뒤에는 새로운 메일을 모델에 넣어 스팸일 가능성을 예측합니다.

간단하게 표현하면 다음과 같습니다.

  • 일반 프로그램: 사람이 만든 규칙 + 입력 → 결과
  • 머신러닝 훈련: 데이터 + 학습 방법 → 모델
  • 머신러닝 추론: 훈련된 모델 + 새로운 입력 → 예측

다만 이 구분을 “일반 프로그램에는 사람이 개입하고 머신러닝은 혼자 만들어진다”로 이해하면 안 됩니다.

사람은 여전히 해결할 문제와 목표를 정하고, 데이터를 모으고, 사용할 특징을 고르고, 모델 구조와 평가 기준을 선택합니다. 훈련된 모델도 데이터 수집·전처리·서비스 코드·모니터링 시스템 안에서 작동합니다.

머신러닝은 사람의 설계를 없애는 기술이 아니라, 모든 판단 규칙을 사람이 일일이 적기 어려운 문제를 데이터와 최적화로 풀게 해주는 방법에 가깝습니다.

머신러닝을 이해하는 여섯 가지 단어

머신러닝 설명에서는 비슷해 보이는 용어가 자주 등장합니다. 다음 여섯 가지를 구분하면 전체 흐름이 훨씬 선명해집니다.

데이터

모델이 학습하거나 평가할 때 사용하는 사례의 모음입니다.

표의 행처럼 정리된 숫자와 범주뿐 아니라 문장, 이미지, 음성, 영상, 센서 값, 사용자 행동 기록도 데이터가 될 수 있습니다.

특징

모델이 결과를 만들 때 입력으로 사용하는 정보입니다. 영어로는 Feature라고 합니다.

집값을 예측한다면 면적, 위치, 방의 수, 건축 연도 등이 특징이 될 수 있습니다. 스팸 분류에서는 메일의 단어, 링크 수, 발신자 정보 등이 특징이 될 수 있습니다.

현대의 딥러닝 모델은 원시 데이터에서 유용한 표현을 스스로 학습하기도 하지만, 무엇을 입력으로 제공할지와 데이터를 어떻게 구성할지는 여전히 중요합니다.

정답 또는 목표값

모델이 예측하려는 값입니다. 문맥에 따라 Label, Target이라고 부릅니다.

주택의 실제 거래 가격, 메일이 스팸인지 아닌지, 사진 속 사물의 이름처럼 정답이 붙은 데이터를 지도학습에 사용할 수 있습니다.

모든 머신러닝에 사람이 만든 정답표가 필요한 것은 아닙니다. 비지도학습이나 자기지도학습처럼 명시적인 정답을 다르게 다루는 방법도 있습니다.

학습 알고리즘

데이터를 이용해 모델의 매개변수를 어떤 방식으로 조정할지 정하는 절차입니다.

같은 데이터를 사용하더라도 선택한 알고리즘, 모델 구조, 목표 함수, 설정값에 따라 다른 모델이 만들어질 수 있습니다.

모델

훈련을 통해 조정된 관계를 담고 있으며, 입력을 받아 결과를 계산하는 대상입니다.

Google의 머신러닝 엔지니어링 안내는 모델을 예측 작업의 통계적 표현으로 설명하고, 사례로 모델을 훈련한 뒤 예측에 사용한다고 정리합니다. (Google — Rules of Machine Learning)

알고리즘이 모델을 만드는 방법이라면, 모델은 그 과정을 거쳐 만들어진 결과물에 가깝습니다.

추론

훈련된 모델을 새로운 입력에 적용해 결과를 만드는 과정입니다. 영어로는 Inference라고 합니다.

사진 분류 모델에 처음 보는 사진을 넣어 종류를 예측하거나, 추천 모델에 현재 사용자의 행동을 넣어 상품을 추천하는 순간이 추론입니다.

Google은 추론을 훈련된 모델을 정답이 없는 새로운 사례에 적용해 예측하는 과정으로 설명합니다. (Google — Static versus dynamic inference)

실제로는 어떻게 학습할까요?

머신러닝에는 여러 학습 방식이 있지만, 가장 이해하기 쉬운 지도학습의 흐름부터 살펴보겠습니다.

주택 가격을 예측하는 모델을 만든다고 가정해볼게요.

1. 해결할 문제를 정합니다

먼저 무엇을 예측할지 정해야 합니다.

‘좋은 집을 찾아준다’는 목표는 너무 모호합니다. ‘면적, 위치, 방의 수를 입력받아 예상 거래 가격을 출력한다’처럼 입력과 결과를 구체적으로 정해야 합니다.

무엇을 성공으로 볼지 평가 기준도 함께 정합니다.

2. 입력과 정답이 있는 사례를 준비합니다

과거 주택의 면적, 위치, 방의 수 같은 정보를 입력 특징으로 모으고 실제 거래 가격을 정답으로 연결합니다.

Google의 자료는 데이터셋을 사례의 모음으로 설명하며, 표에서는 각 행을 하나의 사례, 각 열을 특징이나 정답으로 볼 수 있다고 설명합니다. (Google — Data characteristics)

데이터가 많기만 하면 되는 것은 아닙니다. 실제 사용 환경을 제대로 나타내는지, 잘못된 값이나 누락이 없는지, 정답이 일관되게 붙었는지 확인해야 합니다.

3. 모델이 먼저 예측합니다

초기의 모델은 아직 적절한 관계를 찾지 못했기 때문에 실제 가격과 다른 값을 내놓을 수 있습니다.

예를 들어 실제 가격이 3억 원인 집을 2억 4천만 원으로 예측할 수 있습니다.

4. 예측과 정답의 차이를 계산합니다

지도학습에서는 예측이 실제값과 얼마나 다른지를 하나의 수치로 나타낼 수 있습니다. 이를 손실(Loss)이라고 합니다.

손실이 작아질수록 현재의 학습 목표에 더 가까운 예측을 하고 있다는 뜻입니다.

5. 차이가 줄어들도록 모델을 조정합니다

학습 알고리즘은 손실이 줄어드는 방향으로 모델의 매개변수를 조정합니다.

그리고 다시 예측하고, 차이를 계산하고, 매개변수를 조정합니다. 이 반복을 통해 모델은 데이터에 맞는 관계를 만들어갑니다.

6. 보지 못한 데이터로 확인합니다

훈련에 사용한 데이터만 잘 맞히는 것으로는 부족합니다.

모델이 한 번도 보지 못한 검증 데이터와 테스트 데이터에서도 성능이 유지되는지 확인해야 합니다. 이 과정을 통해 모델이 사례를 단순히 외운 것인지, 새로운 사례에도 적용되는 관계를 찾은 것인지 살펴봅니다.

고양이와 강아지를 동물(1), 사과를 동물 아님(0)으로 학습하고 새로운 입력 토끼를 동물 0.91로 예측하는 지도학습의 네 단계
지도학습에서는 입력과 정답의 예시로 모델을 훈련한 뒤, 보지 못한 토끼를 동물일 가능성 0.91로 예측한다. · DECHIVE

잘 배웠다는 것은 외웠다는 뜻이 아닙니다

시험 문제와 정답을 전부 외운 학생을 생각해보겠습니다.

연습한 문제는 모두 맞히지만 숫자나 문장 표현이 조금만 달라지면 답하지 못한다면, 원리를 배웠다고 말하기 어렵습니다.

머신러닝에서도 비슷한 일이 일어납니다.

모델이 훈련 데이터에 지나치게 맞춰져 새로운 데이터에서 성능이 떨어지는 현상을 과적합(Overfitting)이라고 합니다.

과적합은 모델이 복잡할 때만 생기는 문제가 아닙니다. 데이터가 너무 적거나 한쪽으로 치우쳤을 때, 잘못된 특징이 들어갔을 때도 발생할 수 있습니다.

또한 같은 정보가 훈련 데이터와 평가 데이터에 함께 섞이면 데이터 누수 때문에 실제 일반화 성능을 잘못 평가할 수 있습니다.

그래서 데이터는 보통 용도에 따라 나눕니다.

  • 훈련 데이터: 모델의 매개변수를 조정하는 데 사용
  • 검증 데이터: 모델과 설정을 비교하고 조정하는 데 사용
  • 테스트 데이터: 최종 선택한 모델이 새로운 데이터에 얼마나 잘 적용되는지 확인

Google의 데이터·일반화 교육 자료도 훈련·검증·테스트 데이터의 분리와 과적합 확인을 핵심 학습 목표로 다룹니다. (Google — Datasets, generalization, and overfitting)

중요한 것은 훈련 점수가 아니라 실제 사용할 환경과 비슷한 새로운 데이터에서 유용한 결과를 만드는가입니다.

머신러닝에는 한 가지 학습법만 있는 것이 아닙니다

머신러닝을 분류하는 방식은 설명 목적에 따라 조금씩 달라질 수 있습니다. 처음에는 모델이 어떤 신호를 이용해 배우는지를 기준으로 다음 네 가지를 구분하면 편합니다.

지도학습

입력과 함께 정답이 주어집니다.

스팸인지 아닌지가 표시된 이메일, 실제 가격이 기록된 주택 거래, 사물의 이름이 붙은 사진으로 모델을 훈련하는 방식입니다.

숫자를 예측하는 회귀와 범주를 예측하는 분류가 대표적입니다.

비지도학습

사람이 미리 정한 정답 없이 데이터의 구조나 패턴을 찾습니다.

비슷한 고객을 여러 집단으로 묶거나, 수많은 문서에서 비슷한 주제를 가진 문서를 모으는 군집화가 대표적인 예입니다.

다만 모델이 만든 집단이 실제로 어떤 의미인지 해석하고 활용하는 일은 사람이 해야 합니다.

Google의 입문 자료도 비지도학습을 데이터에서 의미 있는 패턴을 찾는 방식으로 설명하며, 지도학습과 달리 미리 정의된 정답 없이 비슷한 사례를 묶을 수 있다고 설명합니다. (Google for Developers)

자기지도학습

데이터 자체에서 학습할 정답을 만들어냅니다.

문장의 일부를 가리고 원래 내용을 맞히게 하거나, 앞의 단어들을 보고 다음 단어를 예측하게 하는 방식이 여기에 포함될 수 있습니다.

NIST 용어집은 자기지도학습을 사람이 직접 만든 명시적 정답 대신 비정형 데이터에서 암묵적인 정답을 생성해 학습하는 머신러닝으로 설명합니다. (NIST CSRC)

오늘날 대규모 언어 모델은 대량의 텍스트에서 토큰의 통계적 관계를 학습합니다. Google의 언어 모델 자료도 언어 모델을 더 긴 토큰 맥락 안에서 특정 토큰이나 토큰 순서가 나타날 확률을 추정하는 모델로 설명합니다. (Google — Introduction to Large Language Models)

강화학습

모델 또는 에이전트가 환경에서 행동하고, 그 결과로 받은 보상이나 벌점을 바탕으로 더 나은 행동 전략을 찾습니다.

게임 플레이, 로봇 제어, 순차적인 의사결정 문제에 사용될 수 있습니다.

지도학습처럼 정답 하나를 바로 알려주는 대신, 행동의 결과가 얼마나 좋은지 보상으로 알려준다는 차이가 있습니다.

이 네 범주가 항상 서로 완전히 분리되는 것은 아닙니다.

하나의 AI 시스템을 만들 때 자기지도학습으로 기본 모델을 훈련하고, 지도학습으로 특정 작업에 맞춘 뒤, 강화학습 방식으로 행동을 추가 조정할 수도 있습니다.

생성형 AI 역시 별도의 섬처럼 떨어져 있는 학습법이라기보다 새로운 콘텐츠를 만드는 모델의 범주에 가깝습니다. 실제 생성형 AI는 자기지도학습, 지도학습, 강화학습 등 여러 방법을 조합해 훈련될 수 있습니다.

모델은 사용할 때마다 계속 배우는 걸까요?

꼭 그렇지는 않습니다.

학습은 데이터로 모델의 매개변수를 조정하는 과정이고, 추론은 이미 훈련된 모델을 사용해 결과를 만드는 과정입니다.

사용자가 서비스에 질문하고 답을 받는 순간에는 대개 추론이 일어납니다. 질문을 한 번 입력할 때마다 기본 모델의 매개변수가 즉시 바뀐다고 단정할 수는 없습니다.

모델을 한 번 훈련한 뒤 일정 기간 그대로 사용하는 방식을 정적 훈련 또는 오프라인 훈련이라고 합니다. 새로운 데이터를 이용해 지속적으로 또는 자주 다시 훈련하는 방식을 동적 훈련 또는 온라인 훈련이라고 합니다.

Google의 운영 자료도 정적 훈련은 한 번 훈련한 모델을 일정 기간 사용하고, 동적 훈련은 새 데이터에 맞춰 계속 또는 자주 다시 훈련하는 방식으로 구분합니다. 데이터의 관계가 시간에 따라 달라지면 정적 모델의 예측 성능이 낮아질 수 있으므로 입력 데이터의 변화를 계속 관찰해야 한다고 설명합니다. (Google — Static versus dynamic training)

서비스가 사용자 피드백을 수집해 나중의 재학습에 활용하는 것과, 현재 대화 중인 모델이 그 자리에서 곧바로 다시 훈련되는 것은 다른 일입니다.

어떤 서비스가 데이터를 실제 학습에 사용하는지는 해당 서비스의 정책과 설정을 별도로 확인해야 합니다.

머신러닝은 언제 사용하는 것이 좋을까요?

머신러닝이 유용한 문제에는 몇 가지 공통점이 있습니다.

  • 사람이 모든 규칙을 직접 작성하기 어렵다.
  • 충분하고 관련성 있는 사례 데이터를 구할 수 있다.
  • 예측하거나 분류할 목표를 구체적으로 정할 수 있다.
  • 결과가 틀릴 수 있다는 점을 포함해 성능을 측정하고 관리할 수 있다.
  • 시간이 지나면서 반복적으로 결과를 만들어야 한다.

스팸 분류, 수요 예측, 추천, 이미지 인식, 음성 인식처럼 가능한 입력 조합이 많고 패턴이 복잡한 문제에서 머신러닝이 유용할 수 있습니다.

반대로 규칙이 명확하고 결과가 항상 정확히 같아야 하며 예외가 거의 없다면, 일반적인 프로그램이 더 단순하고 안전할 수 있습니다.

세금 계산의 고정 공식, 정해진 시간의 알림 발송, 금액 조건에 따른 배송비 계산에 굳이 머신러닝을 사용할 필요는 없습니다.

Google의 머신러닝 엔지니어링 지침도 제품을 반드시 머신러닝으로 시작해야 하는 것은 아니며, 머신러닝에는 데이터가 필요하고 단순한 휴리스틱이 상당한 효과를 낼 수 있다고 조언합니다. (Google — Rules of Machine Learning)

머신러닝은 복잡한 문제에 강력한 도구이지만, 모든 문제의 기본 답은 아닙니다.

데이터에서 배운다는 것의 한계

머신러닝 모델은 데이터에 들어 있지 않은 진실을 저절로 발견하는 장치가 아닙니다.

먼저 데이터가 현실을 제대로 나타내지 못하면 모델이 찾은 관계도 한쪽으로 치우칠 수 있습니다.

특정 지역의 주택 거래만으로 학습한 모델은 다른 지역에서 잘 작동하지 않을 수 있습니다. 과거의 채용 결과에 편향이 있었다면, 그 데이터를 학습한 모델도 기존의 차별적 패턴을 반복할 수 있습니다.

둘째, 데이터에서 함께 나타난 관계가 원인과 결과를 뜻하는 것은 아닙니다.

우산 판매량과 교통사고가 같은 날 함께 늘었다고 해서 우산이 사고를 일으킨 것은 아닙니다. 비라는 공통 요인이 둘 모두에 영향을 줬을 수 있습니다.

셋째, 학습할 때와 실제 사용할 때의 환경이 달라질 수 있습니다.

사용자 행동, 시장 상황, 센서, 언어 표현이 바뀌면 과거 데이터에서 배운 관계의 유효성이 떨어질 수 있습니다. 이를 데이터 분포의 변화 또는 데이터 드리프트(Data Drift)와 연결해 설명하기도 합니다.

넷째, 모델은 우리가 정한 목표를 따라갑니다.

클릭률만 높이도록 추천 모델을 훈련하면 자극적인 콘텐츠를 더 많이 추천할 수도 있습니다. 측정 지표가 높아진 것과 서비스가 사람에게 더 좋아진 것은 같은 의미가 아닙니다.

Google은 머신러닝 모델의 성능이 훈련 데이터의 품질과 양에 크게 의존하며, 잘못된 정답·잡음·누락된 값 등을 관리해야 한다고 설명합니다. (Google — Data characteristics)

결국 모델의 결과를 이해하려면 알고리즘만 볼 것이 아니라 어떤 데이터로, 어떤 목표를 위해, 어떤 기준으로 학습했는지를 함께 봐야 합니다.

흔한 오해

“머신러닝은 사람이 아무것도 정하지 않아도 스스로 답을 찾는다.”

그렇지 않습니다. 사람은 문제, 데이터, 목표, 모델 구조, 평가 기준, 사용 범위를 정합니다. 모델이 매개변수를 조정하는 것과 시스템 전체가 목적까지 스스로 결정하는 것은 다른 일입니다.

“데이터가 많을수록 무조건 좋은 모델이 된다.”

관련 없거나 잘못된 데이터, 한쪽으로 치우친 데이터가 많아지면 문제도 커질 수 있습니다. 양과 함께 품질·대표성·최신성을 봐야 합니다.

“훈련 데이터를 잘 맞히면 좋은 모델이다.”

훈련 데이터만 잘 맞히고 새로운 데이터에서 실패할 수 있습니다. 그래서 일반화와 과적합을 따로 확인합니다.

“정확도가 높으면 항상 좋은 모델이다.”

드물게 발생하는 사건을 다루는 불균형 데이터에서는 거의 항상 다수 사례만 예측해도 정확도가 높아 보일 수 있습니다. 목적에 따라 정밀도, 재현율, 오류 비용 같은 다른 기준도 살펴야 합니다.

“배포한 모델은 사용할수록 자동으로 계속 배운다.”

정적 모델은 다시 훈련하기 전까지 매개변수가 바뀌지 않습니다. 지속적으로 학습하려면 새 데이터, 재훈련 과정, 검증, 배포와 모니터링 체계가 필요합니다.

“머신러닝과 딥러닝은 같은 말이다.”

딥러닝은 여러 층의 신경망을 사용하는 머신러닝의 한 방식입니다. 선형회귀, 의사결정나무, 서포트 벡터 머신처럼 딥러닝이 아닌 머신러닝 방법도 많습니다.

“학습했다는 것은 사람처럼 이해했다는 뜻이다.”

모델이 데이터의 복잡한 관계를 학습하고 뛰어난 결과를 만들 수는 있지만, 그것만으로 사람과 같은 의미 이해나 의식을 가졌다고 단정할 수는 없습니다.

그래서 무엇을 기억해야 할까요?

머신러닝을 이해할 때는 세 가지를 기억하면 됩니다.

첫째, 머신러닝의 학습은 모델의 매개변수를 데이터에 맞게 조정하는 과정입니다.

사람처럼 경험의 의미를 깨닫는다는 표현과 기술적인 학습을 구분해야 합니다.

둘째, 목표는 훈련 데이터를 외우는 것이 아니라 새로운 입력에도 통하는 관계를 찾는 것입니다.

그래서 훈련 점수만 보는 것이 아니라 검증과 테스트를 통해 일반화를 확인합니다.

셋째, 모델의 능력은 데이터와 목표, 평가 방법의 영향을 받습니다.

데이터에 빠진 사례와 잘못된 정답, 과거의 편향이 있다면 모델의 결과에도 그 흔적이 나타날 수 있습니다.

머신러닝은 사람이 규칙을 전혀 만들지 않는 기술이 아닙니다.

사람이 문제와 목표를 정하고 데이터를 준비하면, 학습 알고리즘이 그 데이터에 맞는 모델을 찾습니다. 그리고 우리는 그 모델이 처음 보는 입력에서도 유용한 결과를 만드는지 확인합니다.

그래서 어떤 서비스가 “머신러닝을 사용한다”고 할 때는 이름만 보는 것보다 다음을 물어보는 편이 좋습니다.

무엇을 예측하는가. 어떤 데이터를 사용했는가. 정답이나 보상은 어떻게 만들었는가. 훈련 데이터가 아닌 새로운 데이터에서도 잘 작동하는가. 환경이 바뀐 뒤에도 성능을 확인하고 있는가.

그 질문에 답할 수 있을 때, ‘데이터에서 배운다’는 말이 비로소 실제 시스템의 모습으로 보이기 시작합니다.

확인한 자료

KEYWORDS

  • 머신러닝
  • 기계학습
  • 인공지능
  • 데이터
  • 모델
  • 지도학습
  • 과적합
  • 일반화
← Knowledge 목록