뉴스만 켜면 새 AI 이름이 나옵니다. 생성형 AI가 화두이던 자리에 AI 에이전트가 왔고, 올해는 피지컬 AI가 다음 시대를 연다고 합니다. 거기에 “생성 AI”, “대화형 AI”처럼 비슷해 보이는 말까지 섞이면 같은 것을 부르는 건지 다른 것인지 알기 어렵습니다. 결론부터 말씀드리면 이 용어들은 경쟁하는 기술이 아니라 능력이 한 단계씩 쌓이는 계층이고, 생성 AI와 대화형 AI는 그 계층과 다른 축에서 붙는 이름입니다. 계층 하나와 축 하나만 잡으면 앞으로 어떤 이름이 나와도 자리를 찾을 수 있습니다.
이 글은 예전에 넷으로 나눠 썼던 용어 글(생성형·에이전트·피지컬 계층, 에이전트 vs 생성형, 피지컬 vs 생성형, 생성 AI·대화형 AI 표기)을 한 편으로 합친 것입니다. 네 주소는 모두 이 글로 연결됩니다.
목차
한 장으로 보는 AI 용어 계층
가장 넓은 말은 그냥 인공지능(AI)입니다. 계산, 추천, 번역, 얼굴 인식처럼 사람의 지적 작업을 흉내 내는 기술 전부를 아우릅니다. 그 안에 데이터를 학습해 새 콘텐츠를 만드는 생성형 AI가 있고, 그 생성 능력을 두뇌로 삼아 스스로 일을 처리하는 AI 에이전트가 있으며, 다시 그 지능이 로봇·자동차 같은 몸을 얻어 현실에서 움직이는 피지컬 AI가 있습니다. 뒤로 갈수록 앞 단계를 품고 확장하는 구조입니다.
| 구분 | 핵심 능력 | 결과물 | 비유 | 2026년의 예 |
|---|---|---|---|---|
| 생성형 AI | 콘텐츠 생성 | 글·이미지·영상·코드 | 답을 만드는 두뇌 | 챗GPT·제미나이·클로드의 채팅 |
| AI 에이전트 | 목표를 향한 자율 실행 | 완료된 작업(예약·조사·정리) | 스스로 일하는 직원 | 브라우저를 직접 조작하는 Claude in Chrome, GPT-6 아스트라 |
| 피지컬 AI | 현실 세계 인지·행동 | 집기·주행·조립 같은 동작 | 몸을 가진 두뇌 | 휴머노이드, 자율주행차, 창고 로봇 |
이 표에서 “위가 아래를 포함한다”만 기억하시면 됩니다. 에이전트는 대개 생성형 AI를 두뇌로 쓰고, 피지컬 AI도 상황을 이해하고 판단하는 부분은 같은 종류의 지능에 기댑니다. 대체가 아니라 확장 관계입니다.
먼저 표기부터 — 생성 AI, 생성형 AI, 대화형 AI
계층으로 들어가기 전에 표기 문제를 정리하겠습니다. “생성 AI”와 “생성형 AI”는 같은 말입니다. 영어 Generative AI를 옮기면서 누구는 “생성 AI”, 누구는 “생성형 AI”로 적었을 뿐 가리키는 대상은 하나입니다. 표준 번역이 정해지지 않아 두 표기가 섞여 쓰이며, 요즘은 “생성형 AI”가 조금 더 널리 쓰입니다. 검색 결과가 갈리는 것도 사람들이 두 표기를 섞어 쓰기 때문이지 다른 기술이어서가 아닙니다.
“대화형 AI”는 층위가 다른 말입니다. 콘텐츠의 종류가 아니라 사용하는 방식, 즉 사람과 말을 주고받는 채팅 형태로 쓰는 AI를 가리킵니다. 그래서 “생성형이냐 대화형이냐”는 애초에 갈라 물을 대상이 아닙니다. 챗GPT는 콘텐츠를 만든다는 점에서 생성형 AI이고, 채팅으로 쓴다는 점에서 대화형 AI입니다. 하나가 두 성격을 동시에 갖습니다.
| 용어 | 무엇을 가리키나 | 예 |
|---|---|---|
| 인공지능(AI) | 지적 작업 전체 | 번역·추천·얼굴 인식 포함 |
| 생성형 AI(=생성 AI) | 새 콘텐츠를 만드는 갈래 | 글·이미지·영상 생성 |
| 대화형 AI | 대화 방식으로 쓰는 형태 | 챗봇·음성 비서 |
주의할 점은 두 잣대가 서로 독립이라는 것입니다. 예전 규칙 기반 챗봇처럼 정해진 답만 골라 내보내는 대화형 서비스도 있으니 “대화형이면 다 생성형”은 아니고, 이미지 생성 AI처럼 대화 없이 결과만 뽑는 생성형 AI도 있으니 “생성형이면 다 대화형”도 아닙니다. 시리·빅스비 같은 음성 비서가 챗GPT와 같은 AI인지는 따로 정리한 글이 있습니다.
생성형 AI — 답을 “만드는” 단계
챗GPT에게 글을 쓰게 하거나 이미지를 뽑는 것이 생성형 AI입니다. 방대한 데이터에서 배운 패턴으로 새로운 결과물을 만들어내지만, 기본적으로 내가 요청해야 반응합니다. 질문을 던지면 그 순간 답을 만들어 주고 거기서 멈춥니다. 모델 이름에 붙는 MoE·Instruct 같은 꼬리표가 무엇인지는 모델 이름 키워드 글에서, 이렇게 만든 글·이미지의 저작권이 누구 것인지는 저작권 글에서 다뤘습니다.
AI 에이전트 — 스스로 “하는” 단계
AI 에이전트는 특정 목표를 받으면 스스로 계획을 세우고, 필요한 도구를 불러 작업을 실행하고, 결과를 확인해 다음 단계로 넘어가는 시스템입니다. IBM의 정의는 “가용 도구를 사용해서 워크플로를 설계하고 작업을 자동으로 수행하는 시스템”입니다. 인식 → 계획 → 실행 → 점검의 사이클을 목표를 이룰 때까지 반복하는 것이 핵심이고, 생성형 AI와의 차이는 한 문장으로 “답을 만든다” 대 “스스로 끝까지 한다”입니다.
| 구분 | 생성형 AI | AI 에이전트 |
|---|---|---|
| 성격 | 반응형(요청에 답) | 목표지향형(알아서 실행) |
| 범위 | 한 번의 답변 | 여러 단계를 연결한 작업 완수 |
| 도구 사용 | 대체로 스스로 하지 않음 | 검색·예약·코드 실행 등 직접 호출 |
| 비유 | 질문에 답하는 조수 | 일을 맡기는 직원 |
“다음 주 부산 출장 준비해 줘”라고 하면 생성형 AI는 체크리스트를 만들어 줍니다. 에이전트는 기차표를 검색·비교하고 숙소 후보를 추리고 일정표에 넣는 것까지 스스로 진행하려 합니다. 2026년에는 이 단계가 눈에 보이는 제품이 됐습니다. 8월 26일 정식 출시된 Claude in Chrome은 내가 로그인한 브라우저를 그대로 조작하고, 9월 3일 나온 GPT-6 아스트라는 “컴퓨터에서 할 수 있는 일은 대신 해 준다”를 내세운 모델입니다. 클로드 코드가 자동 모드를 기본값으로 바꾼 것도 같은 흐름입니다. 사람이 매번 허용 버튼을 누르는 대신 분류기가 위험한 동작만 걸러냅니다.
함께 등장하는 에이전틱 AI(Agentic AI)는 이 개념을 더 밀어붙인 표현입니다. 최소한의 사람 개입으로 목표를 정하고 다단계 작업을 계획·실행·학습하는, 자율성이 한 단계 더 높은 쪽을 가리킵니다. 일반적인 에이전트가 “도구를 쓸 줄 아는 챗봇”이라면 에이전틱 AI는 “스스로 일감을 짜서 끝까지 끌고 가는 디지털 직원”에 가깝습니다. 다만 두 말의 경계는 회사마다 조금씩 다르게 긋습니다.
편리한 만큼 위험도 큽니다. 잘못된 판단이 실제 예약·결제·삭제로 이어질 수 있어서, 중요한 작업은 사람이 최종 승인하도록 설계하는 것이 일반적입니다. 에이전트가 여러 개 돌아갈 때 세션끼리 어떻게 협업하는지는 세션 간 메시징 글에서 다뤘습니다.
피지컬 AI — 현실에서 “움직이는” 단계
피지컬 AI(Physical AI)는 인공지능이 소프트웨어 안에만 머물지 않고, 센서와 모터·제어장치를 통해 현실 세계에서 직접 인지하고 행동하는 기술입니다. 엔비디아의 용어 설명은 “현재의 생성형 AI에 공간 관계와 우리가 살아가는 3D 세계의 물리적 특성에 대한 이해를 더해 확장시킨 기술”이라고 적습니다. 로봇, 자율주행차, 드론, 스마트 공장의 자동화 설비가 대표적입니다. 예전 로봇이 정해진 동작을 반복했다면, 피지컬 AI는 주변을 스스로 인식하고 상황에 맞게 판단해 움직인 뒤 그 결과에서 배웁니다.
| 구분 | 생성형 AI | 피지컬 AI |
|---|---|---|
| 일하는 무대 | 디지털(화면 속) | 현실(물리 세계) |
| 결과물 | 텍스트·이미지·영상·코드 | 주행·집기·조립 같은 동작 |
| 필요한 이해 | 언어·이미지 패턴 | 공간·물리 법칙·시간의 흐름 |
| 비유 | 디지털 두뇌 | 몸을 가진 두뇌 |
쉽게 말해 생성형 AI가 “요리 레시피를 완벽하게 써 주는 셰프”라면, 피지컬 AI는 “그 레시피대로 실제로 팬을 잡고 요리하는 셰프”입니다. 휴대폰 속 음성 비서는 디지털 안에서 답을 주는 것이라 피지컬 AI가 아닙니다. 로봇 팔이나 자율주행처럼 현실 물체를 직접 움직여야 이 이름을 씁니다.
물리적 환각이 왜 더 위험한가
생성형 AI가 그럴듯한 거짓을 지어내는 것을 환각이라고 부릅니다. 피지컬 AI에서는 이 문제가 훨씬 위험해집니다. 물리적 환각은 AI가 현실의 물리 속성이나 센서 정보를 잘못 이해해 생기는 오류입니다. 열화상의 밝은 부분을 단순한 빛으로 착각하거나, 소리가 녹음되지 않은 영상을 보고 “엔진 소리가 들린다”고 판단하는 식입니다. 화면 속 환각은 답을 다시 받으면 그만이지만, 자율주행차나 구조 로봇이 물리적 환각을 일으키면 곧바로 사고입니다. 2026년 7월 31일 KAIST 연구팀이 여러 센서 정보가 뒤섞여 생기는 환각을 대규모 재학습 없이 줄이는 기법을 발표한 것도 이 문제를 겨냥한 연구입니다.
왜 2026년에 화두가 됐나
엔비디아 CEO 젠슨 황은 올해 초 기조연설에서 “피지컬 AI의 챗GPT 모멘트가 왔다”고 말했고, 시뮬레이션 플랫폼과 로봇용 파운데이션 모델을 묶은 개발 스택을 내놓았습니다. 국내에서도 2026년 7월 1일 과학기술정보통신부가 “피지컬 AI 핵심 경쟁력 확보 전략”을 발표해 데이터·기술·확산·생태계 네 축으로 피지컬 AI 파운데이션 모델과 월드 모델, 온디바이스 플랫폼을 확보하겠다고 밝혔습니다. LG전자·KT·KAIST·서울대 등이 컨소시엄으로 참여합니다. 화면 속에서 잘하는 AI를 넘어 현실에서 몸을 쓰는 AI로 무게중심이 옮겨가는 흐름이고, 이 모든 단계가 돌아가려면 막대한 연산이 필요하다는 점은 GPU 인프라 글에서 다뤘습니다.
그래서 어떤 순서로 이해하면 될까
정리하면 두 가지입니다. 첫째, 능력은 생성형 AI(만든다) → AI 에이전트(스스로 한다) → 피지컬 AI(현실에서 움직인다) 순으로 쌓입니다. 둘째, 생성 AI는 생성형 AI의 다른 표기이고 대화형 AI는 쓰는 방식을 가리키는 별도 축입니다. 셋을 각각 떼어 외우기보다 이 두 줄 위에서 새 용어의 자리를 잡아 주면 훨씬 오래 남습니다. 이 용어들은 표준 기구가 정한 것이 아니라 산업계와 연구계에서 쓰이며 굳어진 표현이라, 경계가 조금씩 겹치는 것은 자연스러운 일입니다.
자주 묻는 질문
생성형 AI와 AI 에이전트는 완전히 다른 기술인가요?
아닙니다. 에이전트는 대개 생성형 AI(대규모 언어 모델)를 두뇌로 삼아 판단하고, 거기에 도구 사용과 자율 실행 능력을 얹은 것입니다. 대체가 아니라 확장 관계입니다.
챗GPT도 파일을 읽고 검색을 하던데, 그럼 에이전트인가요?
도구를 쓰기 시작하면 에이전트의 성격을 일부 갖춘 것입니다. 다만 사람이 매 단계 확인해 줘야 한다면 완전한 에이전트라기보다 중간 단계에 가깝습니다. 판단 기준은 “얼마나 스스로 끝까지 가느냐”입니다.
피지컬 AI가 나오면 생성형 AI는 필요 없어지나요?
그렇지 않습니다. 피지컬 AI도 상황을 이해하고 판단하는 부분은 생성형 AI 계열의 추론 능력에 기대는 경우가 많습니다. 위 계층이 아래 계층을 포함한다고 보면 됩니다.
클로바X, 제미나이도 생성형 AI인가요?
네. 텍스트·이미지 같은 새 콘텐츠를 만들어내므로 모두 생성형 AI입니다. 채팅 형태로 쓴다는 점에서 대화형 AI이기도 합니다.
물리적 환각은 완전히 없앨 수 있나요?
현재 기술로는 줄이는 것이 목표입니다. 여러 센서를 교차 검증하고 물리 법칙을 학습시키는 방식으로 오류를 낮추고 있지만, 0으로 만들지는 못한 상태입니다.
이 용어들은 누가 정한 건가요?
표준 기구가 정한 것은 아닙니다. 산업계와 연구계에서 쓰이며 굳어진 표현이라 회사마다 경계를 조금씩 다르게 긋습니다. 이 글의 정의는 IBM과 엔비디아의 공개 설명을 기준으로 삼았습니다.
정리
“만든다 → 스스로 한다 → 현실에서 움직인다”라는 계층 하나와, “생성 AI = 생성형 AI, 대화형 AI는 쓰는 방식”이라는 표기 규칙 하나. 이 둘만 잡고 있으면 AI 용어가 아무리 쏟아져도 흔들리지 않습니다. 원리부터 차근차근 보고 싶다면 AI 이해하기 안내 글에서 읽는 순서를 안내합니다.
참고 자료: IBM AI 에이전트 설명, 엔비디아 피지컬 AI 용어 설명, 대한민국 정책브리핑(피지컬 AI 핵심 경쟁력 확보 전략), KAIST 보도자료 (2026년 9월 6일 확인)