---
title: "오픈 웨이트와 로컬 AI는 데이터센터 추론을 대체할까"
locale: ko
category: ai_data
category_name: "AI 데이터"
translation_status: original
license: cc_by
author: "인조이스 편집팀"
source_url: https://injoys.com/ko/articles/open-weight-local-ai-vs-datacenter-inference
published_at: 2026-08-29T01:01:28+09:00
---

# 오픈 웨이트와 로컬 AI는 데이터센터 추론을 대체할까

> 오픈 웨이트 모델과 개인용 하드웨어가 발전해도 최상위 데이터센터 모델과의 상대적 격차, 배칭과 장비 활용률, 복잡한 AI 에이전트 수요 때문에 고성능 추론의 중심은 데이터센터에 남을 가능성이 높다. 다만 지연 시간, 개인정보보호, 오프라인 작동이 중요한 업무에서는 로컬 모델과 데이터센터 모델을 결합한 하이브리드 구조가 유력하다.

## Key Points

- 미래의 로컬 모델은 오늘의 최상위 모델이 아니라 같은 시점의 데이터센터 모델과 비교해야 한다.
- 작은 모델을 선택하는 문제와 모델을 로컬에서 실행하는 문제는 서로 다른 결정이다.
- 데이터센터는 배칭, 전용 가속기, 높은 장비 활용률을 통해 요청당 비용을 낮출 수 있지만 모든 작업에서 항상 저렴한 것은 아니다.
- 로컬 AI는 짧은 지연 시간, 오프라인 작동, 개인정보보호, 폐쇄망 운영과 모델 통제가 중요한 환경에서 강하다.
- 실용적인 미래 구조는 로컬 모델이 즉시 처리와 요청 분류를 맡고 데이터센터 모델이 고난도 추론을 수행하는 하이브리드 방식에 가깝다.

오픈 웨이트 모델은 개인용 PC와 스마트폰에서도 빠르게 실행될 만큼 작고 효율적으로 발전하고 있다. 그렇다고 장기적으로 고성능 AI 추론의 대부분이 데이터센터에서 개인 기기로 이동한다고 단정할 수는 없다. 로컬 모델이 발전하는 동안 데이터센터의 최상위 모델, 가속기, 추론 소프트웨어도 함께 발전하기 때문이다.

핵심 질문은 ‘미래의 노트북이 오늘의 최상위 모델을 실행할 수 있는가’가 아니다. 같은 시점에 이용할 수 있는 로컬 모델과 데이터센터 모델 가운데 어느 쪽이 원하는 작업을 더 정확하고 경제적으로 끝내는지를 비교해야 한다.

## 먼저 구분해야 할 네 가지 개념

로컬 AI 논쟁에서는 모델의 공개 방식, 크기, 실행 장소가 자주 섞인다. 다음 개념은 별개의 축이다.

| 개념 | 의미 | 반드시 뜻하지 않는 것 |
|---|---|---|
| 오픈 웨이트 | 학습된 가중치를 내려받아 실행할 수 있는 모델 | 학습 데이터와 전체 학습 코드까지 공개된 오픈소스 AI |
| 소형 모델 | 매개변수와 계산 요구량이 상대적으로 작은 모델 | 개인 기기에서만 실행되는 모델 |
| 로컬·온디바이스 추론 | 스마트폰, 노트북, 워크스테이션 등 사용자 가까이에서 실행 | 항상 저렴하거나 환경친화적인 실행 방식 |
| 자체 호스팅 | 조직이 통제하는 서버나 사설 데이터센터에서 실행 | 개인 기기에서의 실행 |

오픈 웨이트는 배포 및 수정 권한이 있는 라이선스와 함께 제공되지만, 사용 범위와 재배포 조건은 모델마다 다르다. 가중치가 공개됐다는 사실만으로 학습 데이터, 학습 절차, 소스 코드까지 모두 공개됐다고 판단해서는 안 된다.

또한 ‘로컬 대 클라우드’라는 이분법은 충분하지 않다. 기업 내부 GPU 서버, 통신사 엣지 서버, 사설 클라우드처럼 기기와 대형 공용 클라우드 사이에 여러 실행 위치가 존재한다.

## 미래의 로컬 모델은 미래의 데이터센터 모델과 경쟁한다

모델 압축, 양자화, 지식 증류와 추론 엔진 최적화가 발전하면 지금은 서버급 장비가 필요한 성능을 미래의 개인 기기에서 구현할 수 있다. 그러나 이것은 로컬 모델이 당시의 최상위 모델을 따라잡는다는 뜻이 아니다.

데이터센터 측에서도 다음 요소가 함께 발전한다.

- 더 큰 모델과 혼합 전문가 모델 같은 새로운 구조
- 고대역폭 메모리와 가속기 간 고속 연결
- 긴 컨텍스트와 외부 도구를 활용하는 추론 시스템
- 배칭, 캐시 관리, 양자화, 추측 디코딩 등 서빙 최적화
- 여러 모델과 검색·코드 실행 도구를 결합한 복합 시스템

따라서 비교 기준은 절대 성능보다 상대 성능이어야 한다. 몇 년 뒤 노트북에서 현재 수준의 강력한 모델을 실행하더라도, 같은 시점의 데이터센터 시스템은 더 긴 작업과 더 큰 컨텍스트, 더 많은 도구 호출을 처리할 가능성이 있다.

물론 이 격차가 영구적으로 유지된다고 보장할 수도 없다. 대형 모델의 성능 개선이 둔화되거나 소형 모델이 대부분의 실무에서 품질 임계점을 넘으면 로컬 실행의 경쟁력이 크게 높아질 수 있다.

## 사용자 기대가 커지면 ‘충분히 좋은 모델’의 기준도 이동한다

초기 생성형 AI의 대표 작업은 짧은 질문 답변, 문장 작성, 요약과 코드 조각 생성이었다. 이제 사용자는 다음과 같은 장기 작업을 요구한다.

- 전체 코드베이스를 읽고 여러 파일을 일관되게 수정하기
- 테스트를 실행하고 실패 원인을 추적한 뒤 다시 수정하기
- 여러 자료를 조사해 상충하는 근거를 비교하기
- 브라우저, 데이터베이스, 터미널 등 여러 도구를 순서대로 사용하기
- 중간 결과를 기억하면서 장기 계획을 완료하기

짧고 단순한 요청에서는 작은 품질 차이가 눈에 잘 띄지 않을 수 있다. 그러나 단계가 많은 AI 에이전트 작업에서는 각 단계의 오류가 누적된다. 상대적으로 약한 모델은 목표나 제약을 놓치고, 잘못된 도구를 선택하거나 같은 실패를 반복할 가능성이 커진다.

이 때문에 사용자는 단순히 실행 가능한 모델보다 예산과 지연 시간 안에서 작업 성공 가능성이 높은 모델을 선택할 수 있다. 과거에 뛰어났던 모델도 더 안정적인 모델을 경험한 뒤에는 복잡한 업무에 답답하게 느껴질 수 있다.

반대 방향의 효과도 있다. 일정 수준 이상의 품질 향상이 실제 업무 결과를 거의 바꾸지 않는다면 저렴한 소형 모델이 합리적이다. 결국 모델 선택은 벤치마크 점수보다 자신의 작업 완료율, 재시도 횟수와 검수 시간을 기준으로 평가해야 한다.

## 데이터센터가 추론 비용에서 갖는 구조적 이점

### 배칭은 모델 가중치 읽기 비용을 여러 요청에 분산한다

LLM이 토큰을 생성하려면 GPU 메모리에 있는 대규모 가중치와 중간 상태에 반복적으로 접근해야 한다. 특히 작은 배치의 디코딩 단계는 연산 능력뿐 아니라 메모리 대역폭의 제약을 크게 받을 수 있다.

데이터센터는 여러 사용자의 요청을 묶거나 연속 배칭으로 실행해 한 번의 가중치 접근에서 여러 토큰을 처리할 수 있다. 다수의 요청이 계속 들어오면 한 요청이 끝난 자리를 다른 요청이 채우는 방식으로 가속기의 유휴 시간을 줄일 수 있다.

개인 사용자는 동시에 발생시키는 요청이 적기 때문에 이 효과를 같은 규모로 얻기 어렵다. 다만 배치를 무작정 키우면 첫 토큰 지연 시간과 요청별 응답 시간이 늘고, KV 캐시 메모리도 더 필요하다. 데이터센터의 이점은 배칭 자체가 아니라 많은 요청을 지연 시간 목표에 맞춰 조정할 수 있다는 데 있다.

### 전용 가속기와 시스템 구성이 다르다

소비자용 GPU도 로컬 추론에 뛰어난 성능을 제공한다. 그러나 대형 데이터센터는 일반적으로 더 큰 가속기 메모리, 높은 메모리 대역폭, 가속기 간 고속 연결과 서버급 네트워크를 활용할 수 있다. 큰 모델을 여러 장비에 분산하거나 긴 컨텍스트를 처리할 때 이런 차이가 중요해진다.

그렇다고 데이터센터용 GPU가 모든 조건에서 소비자용 GPU보다 경제적이라는 뜻은 아니다. 작은 모델을 간헐적으로 사용하고 이미 적합한 장비를 보유했다면 로컬 실행의 현금 지출이 낮을 수 있다. 반대로 높은 처리량이 지속되거나 여러 사용자가 공유한다면 서버 장비와 전문 서빙 소프트웨어의 이점이 커진다.

### 활용률이 총비용을 바꾼다

로컬 GPU의 구매 가격을 이미 지불했다는 이유로 추론 비용을 0으로 계산하면 경제적 비용을 과소평가한다. 총비용에는 다음 항목이 포함된다.

- GPU, 메모리, 저장장치와 전원장치 구매비
- 장비 사용 기간에 따른 감가상각 또는 기회비용
- 추론 중 전력과 냉각 비용
- 설치, 업데이트, 장애 대응과 보안 관리 시간
- 장비가 쉬는 동안 발생하는 낮은 활용률

데이터센터 서비스도 가속기, 네트워크, 전력, 인력과 사업자의 마진을 요금에 반영한다. 따라서 로컬과 API 중 어느 쪽이 저렴한지는 사용량, 모델 크기, 장비 보유 여부, 전기요금, 응답 속도와 운영 인력에 따라 달라진다.

특정 환경에서 수십 배의 효율 차이가 날 수 있다는 추정치를 모든 환경의 보편적 비율로 사용해서는 안 된다. 배치 크기, 입력과 출력 길이, 모델 구조, 양자화 수준, 하드웨어 및 지연 시간 목표가 달라지면 결과도 크게 변한다.

## 작은 모델과 로컬 실행은 같은 선택이 아니다

간단한 분류, 형식화된 정보 추출, 짧은 요약, 명령 라우팅과 기본 교정에는 소형 모델이 충분할 수 있다. 그러나 소형 모델을 선택했다고 해서 반드시 사용자 기기에서 실행해야 하는 것은 아니다.

소형 모델도 데이터센터에서 대량 요청을 배칭하면 높은 활용률을 얻을 수 있다. 반대로 조직이 통제해야 하는 대형 오픈 웨이트 모델은 자체 서버에서 실행할 수 있다. 의사결정은 두 단계로 나누는 편이 정확하다.

1. 작업에 필요한 품질과 기능을 만족하는 모델 크기와 유형을 고른다.
2. 지연 시간, 비용, 보안과 운영 여건에 맞는 실행 위치를 고른다.

이 두 단계를 섞으면 ‘작은 모델이 효율적이므로 로컬이 효율적이다’ 또는 ‘큰 모델이 필요하므로 공용 클라우드를 써야 한다’는 잘못된 결론에 도달할 수 있다.

## 로컬 AI가 분명히 유리한 조건

### 짧은 지연 시간이 핵심인 인터페이스

음성 대화, 키보드 보정, 카메라 처리와 실시간 제어에서는 네트워크 왕복 시간과 연결 변동이 사용자 경험을 크게 바꾼다. 작은 로컬 모델은 깨우기 단어 감지, 음성 전처리, 간단한 명령과 즉각적인 피드백을 맡을 수 있다.

### 인터넷이 없거나 불안정한 환경

항공기, 선박, 재난 현장, 원격 지역과 이동 중인 장비에서는 오프라인 작동 자체가 핵심 기능이다. 데이터센터 모델의 품질이 더 높더라도 연결할 수 없다면 선택지가 되지 않는다.

### 개인정보와 기밀정보를 외부로 보낼 수 없는 환경

의료, 금융, 국방, 연구개발, 법률 업무나 기업 내부 자료에는 외부 API 전송을 제한하는 규정과 계약이 적용될 수 있다. 로컬 또는 자체 호스팅 모델은 데이터 경계를 직접 통제할 수 있다는 가치가 있다.

다만 ‘로컬이므로 자동으로 안전하다’고 볼 수는 없다. 장치 탈취, 악성코드, 접근권한 오류, 로그와 임시 파일, 모델 공급망 문제는 여전히 관리해야 한다. 공용 클라우드도 암호화, 보존 기간, 지역 선택과 계약 조건에 따라 보안 수준이 달라진다.

### 모델을 직접 통제하고 실험해야 하는 경우

오픈 웨이트 모델은 연구자가 내부 동작을 분석하고, 개발자가 양자화와 미세조정 및 추론 엔진을 바꾸는 데 유용하다. API에서 제공하지 않는 모델 버전 고정, 세부 로깅, 재현성이나 사용자 정의 배포가 필요할 때도 자체 실행의 가치가 커진다.

## 데이터센터 추론이 강한 조건

다음과 같은 작업은 일반적으로 데이터센터 자원을 활용할 이유가 크다.

- 매우 큰 모델이나 긴 컨텍스트가 필요한 작업
- 대규모 코드 저장소와 문서 집합을 한꺼번에 분석하는 작업
- 여러 도구를 사용하며 장시간 진행되는 AI 에이전트 작업
- 많은 사용자의 요청을 지속적으로 처리하는 서비스
- 장애 대응, 확장, 모델 업데이트를 전문 운영팀에 맡겨야 하는 조직
- 여러 가속기와 대용량 메모리가 필요한 멀티모달 처리

데이터센터의 가치는 단일 모델의 토큰 생성 성능에만 있지 않다. 검색 인덱스, 데이터베이스, 샌드박스 코드 실행, 관찰 도구와 안전 정책을 하나의 시스템으로 운영할 수 있다는 점도 중요하다.

## 하이브리드 AI가 유력한 이유

현실적인 설계는 로컬과 데이터센터 중 하나를 고정적으로 선택하기보다 작업을 분할하는 방식이다.

| 단계 | 로컬 모델이 맡기 좋은 기능 | 데이터센터 모델이 맡기 좋은 기능 |
|---|---|---|
| 입력 처리 | 음성 감지, 전사 보조, 개인정보 마스킹 | 대규모 멀티모달 이해 |
| 요청 판단 | 의도 분류, 간단한 명령, 라우팅 | 모호한 목표 해석과 복잡한 계획 |
| 실행 | 기기 설정, 짧은 요약, 캐시된 답변 | 심층 리서치, 대규모 코드 분석, 장기 에이전트 작업 |
| 안전과 복구 | 전송 전 민감정보 필터링, 오프라인 대체 | 중앙 정책 적용, 고급 위험 탐지, 전체 기록 분석 |

예를 들어 스마트폰의 로컬 모델이 음성을 처리하고 민감정보를 제거한 뒤, 복잡한 부분만 데이터센터 모델로 보낼 수 있다. 네트워크가 끊기면 제한된 기능을 로컬에서 계속 제공하고, 연결이 복구되면 고난도 작업을 넘기는 방식도 가능하다.

이 구조에서는 사용자가 로컬 AI와 상호작용한다고 느끼더라도 가장 어려운 계산은 데이터센터에서 수행될 수 있다. 반대로 모든 원본 데이터를 서버로 보내지 않고 필요한 정보만 전달할 수 있어 개인정보 노출 범위를 줄일 수 있다.

## 빠지기 쉬운 변수: 운영 신뢰성과 라우팅 비용

모델 비교는 흔히 정확도, 토큰 속도와 API 가격에 머문다. 실제 시스템에서는 운영 신뢰성과 라우팅 실패가 전체 효율을 좌우한다.

하이브리드 시스템은 어떤 요청을 로컬에서 끝내고 어떤 요청을 서버로 보낼지 판단해야 한다. 약한 모델이 어려운 작업을 잘못 떠맡으면 여러 번 실패한 뒤 결국 데이터센터 모델을 호출하게 된다. 이 경우 로컬 계산, 지연 시간과 서버 비용을 모두 지불한다.

반대로 간단한 요청까지 항상 최상위 모델로 보내면 불필요한 비용과 데이터 전송이 늘어난다. 따라서 좋은 라우터에는 다음 기능이 필요하다.

- 작업 난이도와 필요한 컨텍스트를 추정하는 기준
- 로컬 결과의 불확실성을 감지하는 방법
- 실패 횟수나 시간 한도를 넘으면 상위 모델로 전환하는 정책
- 민감정보를 서버 전송 전에 제거하거나 승인을 받는 절차
- 로컬과 서버 모델의 버전 차이를 관리하는 평가 체계

이는 단순한 하드웨어 비교에서 놓치기 쉬운 요소다. 미래의 경쟁력은 가장 큰 모델을 보유했는지보다 작업을 적절한 모델과 실행 위치로 얼마나 정확하게 배분하는지에 달릴 수 있다.

## 비용과 성능을 직접 비교하는 방법

로컬과 데이터센터 가운데 하나를 선택하려면 최소한 다음 항목을 같은 기간과 같은 작업 단위로 비교해야 한다.

### 로컬 월환산 비용

`장비 월환산 비용 + 전력·냉각 비용 + 운영 시간의 가치 + 장애·교체 비용`

이를 한 달 동안 성공적으로 완료한 작업 수로 나누면 작업당 비용을 추정할 수 있다. 단순 토큰 수보다 성공한 작업을 기준으로 삼아야 재시도와 사람의 검수 비용이 반영된다.

### 데이터센터 월비용

`입력·출력 사용료 + 저장·검색·도구 사용료 + 네트워크 비용 + 관리 비용`

예약형 또는 전용 인스턴스를 사용한다면 사용하지 않은 시간도 비용에 포함해야 한다.

### 함께 측정할 품질 지표

- 작업을 수정 없이 완료한 비율
- 평균 재시도 횟수
- 첫 응답과 전체 완료까지 걸린 시간
- 사람이 검수하고 수정하는 데 든 시간
- 서비스 중단과 네트워크 실패율
- 민감정보가 외부로 전송되는 범위

짧은 시험 요청 몇 개만으로 결론을 내리지 말고 실제 업무를 대표하는 고정 평가 세트를 만들어 비교하는 것이 좋다.

## 에너지와 환경성도 실행 장소만으로 판단할 수 없다

로컬 처리가 네트워크 전송을 줄인다는 이유만으로 항상 에너지를 적게 쓰는 것은 아니다. 데이터센터는 높은 장비 활용률과 효율적인 냉각을 활용할 수 있지만, 대규모 시설 운영과 전력망 부담도 발생시킨다.

환경 영향을 비교하려면 다음 요소를 함께 봐야 한다.

- 작업당 실제 소비 전력
- 장비의 평균 활용률
- 데이터센터의 냉각 및 전력 손실
- 지역별 전력원의 탄소 집약도
- GPU와 기기 제조에 포함된 내재 배출량
- 모델 실패와 재시도로 낭비되는 계산량

같은 모델이라도 유휴 시간이 긴 개인용 GPU와 높은 배치로 운영되는 서버의 작업당 에너지는 다를 수 있다. 반대로 이미 보유한 저전력 기기에서 작은 모델을 짧게 실행하는 작업은 서버 호출보다 효율적일 수 있다. 측정 범위와 작업 조건을 밝히지 않은 보편적 친환경 주장은 경계해야 한다.

## 로컬 AI가 중심이 될 수 있는 세 가지 변화

데이터센터 중심 전망이 바뀔 가능성도 있다.

1. **데이터센터 공급이 외부 조건으로 제한되는 경우**: 전력망, 반도체 공급, 규제 또는 데이터 주권 문제로 대규모 중앙 추론을 확장하기 어려워질 수 있다.
2. **소형 모델의 효율 개선이 대형 모델보다 훨씬 빨라지는 경우**: 개인 기기에서 실행 가능한 모델이 실제 업무 품질에서 대형 모델에 근접하면 추가 성능에 비용을 지불할 이유가 줄어든다.
3. **대부분의 업무가 품질 포화점에 도달하는 경우**: 더 큰 모델이 있어도 사용자가 체감할 만한 작업 성공률 개선이 거의 없다면 로컬의 비용·지연·보안 이점이 우세해질 수 있다.

그러나 대형 모델만 발전을 멈춘다거나 사용자의 요구 수준이 고정된다고 전제할 근거도 충분하지 않다. 모델이 강해질수록 사용자는 더 긴 작업과 더 어려운 문제를 맡기는 경향이 있기 때문이다.

## 결론

로컬 AI는 사라지지 않는다. 음성 인터페이스, 즉시 반응, 오프라인 기능, 개인정보보호, 폐쇄망과 모델 통제가 필요한 분야에서 오히려 중요성이 커질 가능성이 높다.

다만 로컬 모델이 발전한다는 사실만으로 고성능 데이터센터 추론이 대체된다고 결론 내릴 수는 없다. 데이터센터도 더 강한 모델과 전용 장비, 배칭 및 높은 활용률을 바탕으로 함께 발전한다. 복잡한 추론과 장기 AI 에이전트 작업에서는 작은 성능 차이가 최종 작업 성공률과 검수 비용의 큰 차이로 이어질 수 있다.

따라서 장기적으로는 로컬과 데이터센터의 승패보다 역할 분담이 중요하다. 로컬 모델은 입력 처리, 즉시 반응, 민감정보 보호와 요청 라우팅을 담당하고, 데이터센터 모델은 대규모 자원과 높은 추론 능력이 필요한 업무를 맡는 하이브리드 구조가 가장 현실적인 방향이다.

## FAQ

### 오픈 웨이트 모델은 오픈소스 AI와 같은 뜻인가요?
아닙니다. 오픈 웨이트는 학습된 가중치를 내려받아 실행할 수 있다는 뜻이지만 학습 데이터, 전체 학습 코드와 개발 과정까지 공개됐다는 뜻은 아닙니다. 수정과 상업적 사용, 재배포가 가능한지도 개별 라이선스로 확인해야 합니다.

### 미래에는 스마트폰이 현재의 최상위 AI 모델을 실행할 수 있을까요?
양자화, 증류, 하드웨어와 추론 엔진이 발전하면 가능할 수 있습니다. 그러나 그 시점의 데이터센터 최상위 모델도 함께 발전하므로 현재 모델을 실행할 수 있다는 사실만으로 클라우드 수준을 따라잡았다고 판단할 수는 없습니다.

### GPU를 이미 보유했다면 로컬 AI 추론 비용은 무료인가요?
API 요금은 없을 수 있지만 경제적 비용이 0은 아닙니다. 전기료, 장비 감가상각, 냉각, 유지보수, 장애 대응과 낮은 활용률을 포함해 계산해야 합니다.

### 데이터센터의 배칭이 비용을 줄이는 이유는 무엇인가요?
여러 요청의 토큰을 함께 처리하면 모델 가중치 접근과 가속기 사용을 여러 사용자에게 분산할 수 있기 때문입니다. 다만 큰 배치는 지연 시간과 메모리 사용을 늘릴 수 있어 요청량과 응답 목표에 맞춘 조정이 필요합니다.

### 작은 모델은 로컬에서 실행하는 것이 항상 효율적인가요?
아닙니다. 작은 모델도 데이터센터에서 많은 요청을 배칭하면 높은 장비 활용률을 얻을 수 있습니다. 모델 크기와 실행 위치는 별개로 결정해야 합니다.

### 로컬 AI는 클라우드 AI보다 항상 개인정보보호에 유리한가요?
원본 데이터를 외부 서버로 보내지 않을 수 있다는 점에서는 유리합니다. 그러나 장치 탈취, 악성코드, 권한 설정, 로컬 로그와 모델 공급망 위험이 남으므로 로컬 실행만으로 보안이 자동 보장되지는 않습니다.

### 어떤 작업을 로컬 모델에 맡기는 것이 적합한가요?
음성 전처리, 간단한 분류와 요약, 명령 라우팅, 개인정보 마스킹, 오프라인 기능처럼 지연 시간이 짧아야 하고 계산량이 제한적인 작업이 적합합니다.

### 어떤 작업은 데이터센터 모델이 더 적합한가요?
대규모 코드 분석, 심층 리서치, 긴 컨텍스트 처리, 복잡한 계획 수립과 여러 도구를 사용하는 장기 AI 에이전트 작업처럼 많은 메모리와 높은 추론 성능이 필요한 작업이 해당합니다.

### 하이브리드 AI란 무엇인가요?
간단하고 민감하거나 즉각적인 작업은 사용자 기기의 로컬 모델이 처리하고, 더 복잡한 작업만 데이터센터 모델로 보내는 구조입니다. 라우팅 정책과 실패 시 상위 모델로 전환하는 절차가 시스템 품질을 좌우합니다.

### 로컬 AI가 데이터센터 AI보다 환경친화적인가요?
실행 장소만으로 판단할 수 없습니다. 장비 활용률, 작업당 전력, 냉각 효율, 지역 전력원, 하드웨어 제조와 모델 재시도까지 같은 범위에서 비교해야 합니다.

## Sources

- [Efficient Memory Management for Large Language Model Serving with PagedAttention](https://arxiv.org/abs/2309.06180)
- [NVIDIA Triton Inference Server: Model Batcher](https://docs.nvidia.com/deeplearning/triton-inference-server/user-guide/docs/user_guide/batcher.html)
- [NVIDIA H100 Tensor Core GPU](https://www.nvidia.com/en-us/data-center/h100/)
- [llama.cpp](https://github.com/ggml-org/llama.cpp)
- [MLC LLM](https://llm.mlc.ai/)
- [Open Source AI Definition](https://opensource.org/ai/open-source-ai-definition)
- [The NIST Definition of Cloud Computing](https://nvlpubs.nist.gov/nistpubs/Legacy/SP/nistspecialpublication800-145.pdf)
- [NIST Privacy Framework](https://www.nist.gov/privacy-framework)

## Images

![서버실에서 소형 컴퓨터에 네트워크 케이블을 연결하는 여성 기술자](https://injoys.com/rails/active_storage/blobs/proxy/eyJfcmFpbHMiOnsiZGF0YSI6MTI4MzQsInB1ciI6ImJsb2JfaWQifX0=--5e4537efdba3022405de8e104a427be983bc2583/ai-1a48fd1a.webp)
![노트북·스마트폰의 로컬 AI와 데이터센터 서버를 연결해 처리 흐름과 성능 지표를 비교한 도식](https://injoys.com/rails/active_storage/blobs/proxy/eyJfcmFpbHMiOnsiZGF0YSI6MTI4NDIsInB1ciI6ImJsb2JfaWQifX0=--a8be6416f77c81039aabe891f1acfde95507c889/ai-c2164fd3.webp)
![로컬 AI와 데이터센터 추론의 장점, 하이브리드 구조, 라우팅 오류를 비교한 인포그래픽](https://injoys.com/rails/active_storage/blobs/proxy/eyJfcmFpbHMiOnsiZGF0YSI6MTI4NDgsInB1ciI6ImJsb2JfaWQifX0=--82a362464724c5d42b066b2f51be042c0ab60bf1/ai-d5b2e61d.webp)