기업의 AI 전환, 즉 AX는 직원에게 생성형 AI 계정을 배포하는 것만으로 완성되지 않는다. 실제 성과를 내려면 AI가 회사의 업무 상태를 관측하고, 허용된 행동을 선택하고, 실행 결과에서 학습하도록 환경을 구조화해야 한다.
이때 필요한 것이 비즈니스 월드 모델이다. 다만 이 표현은 아직 모든 기업과 연구기관이 동일하게 사용하는 표준 용어는 아니다. 여기서는 기업의 개체·관계·규칙·상태·행동·성과를 AI가 추론하고 검증할 수 있도록 표현한 운영 환경 모델이라는 의미로 사용한다.
AX의 기준이 도입량에서 ROI로 바뀌는 이유
초기 생성형 AI 도입에서는 계정 수, 이용률, 생성 문서 수와 같은 활동 지표가 주로 사용됐다. 그러나 이 지표만으로는 매출 증가, 비용 절감, 처리 시간 단축 또는 위험 감소를 입증하기 어렵다.
Gartner는 2025년 공개한 전망에서 비용 상승, 불명확한 사업 가치, 불충분한 위험 통제 등을 이유로 2027년 말까지 에이전틱 AI 프로젝트의 40% 이상이 취소될 것으로 예상했다. RAND의 AI 프로젝트 실패 연구도 기술보다 데이터 품질, 문제 정의, 조직의 기대와 실제 역량 사이의 간극을 주요 원인으로 제시한다.
특정 발표나 조사에서 제시되는 실패율은 조사 대상과 실패 정의가 서로 다르다. 따라서 출처와 모집단이 확인되지 않은 ‘88% 실패’ 또는 ‘46% 중단’ 같은 수치를 전체 AX 프로젝트의 보편적 통계로 사용해서는 안 된다.
기존 DX 방식이 그대로 통하지 않는 이유
전통적인 업무 시스템은 입력과 처리 규칙이 비교적 명확한 정적 도구다. 반면 AI 에이전트는 다음 과정을 반복하는 동적 시스템이다.
- 문서, 데이터베이스, API 또는 사용자 요청을 관측한다.
- 현재 상태와 목표를 해석한다.
- 도구나 다음 행동을 선택한다.
- 외부 시스템에 영향을 주는 작업을 실행한다.
- 결과를 확인하고 계획을 수정한다.
확률적으로 행동하는 에이전트에 기존 시스템과 같은 권한을 곧바로 부여하면 잘못된 주문, 규정 위반, 개인정보 노출 또는 복구하기 어려운 변경이 발생할 수 있다. 따라서 도구 사용 범위, 승인 절차, 중단 조건, 로그와 복구 수단을 함께 설계해야 한다.
파인튜닝·RAG·하네스·루프·월드 모델의 차이
각 접근법은 서로 대체 관계가 아니라 다른 문제를 해결하는 구성 요소다.
| 접근법 | 주된 목적 | 잘하는 일 | 단독 적용의 한계 |
|---|---|---|---|
| 파인튜닝 | 모델의 행동이나 출력 성향 조정 | 특정 형식, 분류, 어조, 반복 작업 최적화 | 최신 사내 지식과 변경되는 규칙을 지속적으로 반영하기 어렵다 |
| RAG | 실행 시점에 외부 지식 검색 | 최신 문서, 매뉴얼, 사례와 근거 제공 | 검색된 내용이 현재 상태에 적용 가능한지 보장하지 않는다 |
| 하네스 엔지니어링 | 모델 주변 실행 장치 구성 | 도구 연결, 메모리, 권한, 관측 가능성, 오류 처리 | 업무 의미와 정책이 잘못 정의되면 정교한 하네스도 잘못된 일을 자동화한다 |
| 루프 엔지니어링 | 관측·계획·실행·평가 반복 설계 | 재시도, 자기 수정, 사람 승인, 결과 피드백 | 종료 조건이 약하면 비용 증가와 오류 반복이 발생한다 |
| 비즈니스 월드 모델 | 기업 환경과 상태 변화를 명세 | 실행 가능성, 정책 적합성, 영향 추적, 시뮬레이션 | 구축과 유지에 도메인 전문가의 지속적인 참여가 필요하다 |
파인튜닝 자체를 낭비라고 일반화할 수는 없다. 안정적인 작업 형식이나 반복 행동을 모델에 내재화할 때 유용하다. 다만 자주 변경되는 가격 정책, 승인 한도, 재고 상태와 같은 사실을 모델 가중치에만 저장하면 갱신과 감사가 어려워진다. 이런 정보는 검색 계층, 규칙 계층 또는 운영 데이터베이스에서 관리하는 편이 일반적으로 적합하다.
비즈니스 월드 모델의 구성 요소
좋은 월드 모델은 문서를 많이 모은 지식 저장소와 다르다. 회사에서 무엇이 존재하고, 어떤 상태이며, 누가 무엇을 할 수 있고, 행동 후 상태가 어떻게 바뀌는지를 표현해야 한다.
| 구성 요소 | 질문 | SCM·프로모션 예시 |
|---|---|---|
| 개체 | 무엇이 존재하는가? | 제품, 고객군, 지역, 창고, 채널, 캠페인 |
| 관계 | 개체는 어떻게 연결되는가? | 제품별 공급처, 지역별 판매 채널 |
| 상태 | 현재 무엇이 사실인가? | 재고량, 판매가, 계약 상태, 예산 잔액 |
| 행동 | 어떤 변경을 실행할 수 있는가? | 가격 변경, 발주, 광고 집행, 캠페인 중단 |
| 전이 조건 | 행동 후 상태가 어떻게 바뀌는가? | 발주 승인 후 가용 예산 감소와 입고 예정량 증가 |
| 제약 | 무엇이 금지되거나 제한되는가? | 최소 마진, 할인 상한, 개인정보 사용 제한 |
| 권한 | 누가 무엇을 승인하는가? | 할인율 구간별 팀장·임원 승인 |
| 목표 | 무엇을 최적화하는가? | 매출이 아니라 마진, 재고 회전율, 품절 위험의 조합 |
| 관측 | 결과를 무엇으로 확인하는가? | 주문, 반품, 광고비, 실제 마진, 고객 불만 |
이 구조는 온톨로지, 지식 그래프, 규칙 엔진, 상태 저장소, 프로세스 모델, 시뮬레이터와 정책 코드 등 여러 기술로 구현할 수 있다. 반드시 하나의 거대한 모델이나 특정 제품이어야 하는 것은 아니다.
뉴로심볼릭 구조는 어떻게 작동하는가
뉴로심볼릭 AI는 신경망의 패턴 인식·생성 능력과 명시적 기호·논리 표현을 결합하는 접근이다. 기업용 월드 모델에서는 두 계층을 다음과 같이 분업시킬 수 있다.
뉴럴 계층: 후보 생성과 불확실성 처리
LLM이나 예측 모델은 비정형 문서를 해석하고, 수요를 예측하며, 다양한 실행 시나리오를 생성하는 데 유리하다. 예를 들어 제품, 지역, 가격, 광고비, 채널 수수료를 조합해 여러 프로모션 후보를 제안할 수 있다.
그러나 생성된 후보는 사실처럼 보이더라도 실제 재고, 계약 또는 승인 정책을 위반할 수 있다. 뉴럴 출력은 실행 명령이 아니라 검증 전 후보로 취급해야 한다.
심볼릭 계층: 확정 규칙과 실행 가능성 검증
심볼릭 계층은 다음과 같은 명시적 조건을 검사한다.
- 할인 후 예상 마진이 회사의 하한선 이상인가?
- 해당 지역에서 제품을 판매할 계약상 권한이 있는가?
- 캠페인 예산이 남아 있는가?
- 고객 데이터 사용 목적이 동의 범위 안에 있는가?
- 실행이 실패했을 때 원상 복구할 수 있는가?
- 요구되는 사람의 승인을 받았는가?
규칙 검사를 통과했다는 사실은 정책 적합성을 의미할 뿐, 사업 성과가 날 확률을 자동으로 의미하지는 않는다. ‘신뢰도 90%’와 같은 수치를 제공하려면 과거 예측과 실제 결과를 비교해 확률을 보정하는 캘리브레이션 절차가 필요하다.
SCM 프로모션 기획의 폐쇄형 실행 루프
1. 상태 관측
시스템이 재고, 공급 일정, 판매 실적, 가격, 마진, 광고비와 채널 수수료를 읽는다. 데이터의 기준 시각과 출처도 함께 기록한다.
2. 후보 생성
뉴럴 모델이 매출과 마진, 재고 소진, 품절 가능성 등을 고려해 여러 프로모션 후보를 만든다. 시뮬레이션을 사용한다면 수요 분포와 가격 탄력성 등 가정을 명시해야 한다.
3. 정책 검증
심볼릭 계층이 할인 상한, 최소 마진, 재고 제약, 계약 조건과 승인 권한을 검사한다. 위반 후보는 폐기하거나 허용 범위 안으로 수정한다.
4. 위험 기반 승인
추천 문구 작성처럼 되돌리기 쉬운 행동은 자동화할 수 있다. 반면 가격 변경, 대량 발주, 고객 접촉과 같이 영향이 큰 행동은 사람의 승인을 요구한다. 금액, 대상 고객 수, 가역성에 따라 승인 수준을 다르게 설정할 수 있다.
5. 실행과 추적
선택한 캠페인의 예상 매출, 마진, 비용, 위험 범위를 실행 전에 저장한다. 실행 후 실제 결과와 비교해 오차와 정책 위반 여부를 추적한다.
6. 중단과 학습
손실 한도, 예측 범위 이탈 또는 데이터 이상이 감지되면 자동 중단하거나 사람에게 이관한다. 실패 원인을 데이터 오류, 가정 오류, 규칙 누락, 모델 오류, 외부 환경 변화로 구분해 다음 실행에 반영한다.
로그인이 필요합니다
좋아요와 댓글을 남기려면 Google 계정으로 로그인하세요.