온프레미스 멀티에이전트
RAG 아키텍처

범용 LLM 클라우드 호출이 아니라, 사내 데이터로 학습한 자사 sLLM과 멀티에이전트로 동작합니다. 모든 모델과 데이터가 고객사 사내망에서 완전히 격리되어 운영되며, 범용 LLM 대비 비용을 약 1/10 수준으로 낮춥니다.

Stack

기술 스택

검색 · 지식 (RAG)

Search Engine · Vector DB · PDF Parser(핵심특허)에 Reranking Agent(특허)를 더해 검색 정확도를 높이고, 사내 문서를 학습(Sphinx X)·인덱싱합니다.

에이전트 · 실행

멀티에이전트 오케스트레이션과 Tool Call로 검색·작성·검증을 수행합니다. Comment System(문장 Type 추천·PDF Layer Markup)과 원문 인용으로 환각을 방지하고 권한·보안 레벨별로 답변합니다.

모델 · 서빙

자사 sLLM 파인튜닝과 vLLM On-Prem 서빙. 사내망 완전 격리로 비용을 크게 낮추고 특정 벤더에 종속되지 않습니다.

Physical · 학습·배포

학습은 시뮬레이션(NVIDIA Cosmos·Isaac Sim/Lab), 배포는 On-Premise(Jetson Thor). Digital Twin과 단일작업 모방학습으로 산업 신뢰성을 확보합니다.

Architecture

동작 원리 — On-Premise 멀티에이전트 RAG

이해 → 추론·계획 → 실행 → 근거·신뢰 → 서빙을 하나의 온프레미스 파이프라인으로 연결합니다.

이해문서·코드 파싱·인덱싱(RAG) — PDF 구조좌표·메타데이터를 가변포맷으로 변환해 Vector DB에 인덱싱
추론·계획멀티에이전트 오케스트레이션 — 작업을 분해하고 도구를 선택해 검색·작성·검증을 계획
실행Tool Call — 검색·작성·검증 도구를 호출하고 Comment System으로 문장 Type 추천·PDF Layer Markup
근거·신뢰원문 인용으로 Hallucination 방지, 권한·보안 레벨별 답변으로 데이터 접근 제어
서빙자사 sLLM(파인튜닝) · vLLM On-Prem — 사내망 완전 격리, GPU 온프레미스 서버에서 운영
Agent AI 기술 스택: 검색·지식(RAG: Search Engine·Vector DB·PDF Parser·Reranking Agent), 에이전트·실행(멀티에이전트 오케스트레이션·Tool Call·Comment System), 모델·서빙(자사 sLLM·SK A.X. 72B·GPT OSS 120B·코딩 MoE·vLLM On-Prem)
Agent AI 기술 스택 — 검색·지식(RAG) · 에이전트·실행 · 모델·서빙
Models

모델 · 서빙 라인업

업무에 맞는 모델을 선택·파인튜닝해 온프레미스 vLLM으로 서빙합니다.

자사 sLLM파인튜닝 언어모델 — 사내 문서·도메인 데이터로 학습한 경량 sLLM
범용 베이스SK A.X. 72B · GPT OSS 120B — 대형 베이스 모델 선택 활용
코딩 MoEQwen3-Coder 80B · GLM — 코드 전용 MoE sLLM (2노드 8GPU 분산추론)
서빙vLLM On-Prem — GPU 온프레미스 서버, 권한·보안 레벨별 서빙
Principle

왜 온프레미스 자사 sLLM 인가

부서 요구사항을 먼저 분석해 소형 언어모델(sLLM)을 도입하는 Bottom-Up 전략으로, 변화에 유연하고 현장 정확도가 높습니다.

01

완전 격리

문서·소스코드가 외부로 전송되지 않고 폐쇄망에서도 운영됩니다. 클라우드 불가 시장을 선점합니다.

02

비용 1/10

사내망 격리 운영으로 외부 API 비용이 없어 범용 LLM 대비 도입·운영 비용을 크게 낮춥니다.

03

Lock-in 방지

특정 벤더에 종속되지 않고 도메인 데이터를 직접 소유합니다. Talk↔Factory↔Robot 통합 생태계로 확장됩니다.

Physical AI

학습은 시뮬레이션, 배포는 On-Premise

범용 VLA(연구 신뢰도 60~80%)는 소규모팀·산업현장에 부적합 → 단일작업 모방학습으로 99%대 산업 신뢰성을 확보합니다.

업스트림·학습NVIDIA Cosmos · Isaac Sim/Lab — 합성데이터 생성(SDG)·대규모 시뮬레이션 학습
정책·배포ACT / Diffusion Policy — 협동로봇 단일작업 모방학습(50~200 시연), 휴머노이드 GR00T(로드맵)
엣지Jetson AGX Thor — On-Premise 엣지 배포 · Sphinx AI Factory 연동
Physical AI 기술 스택: 업스트림 학습(NVIDIA Cosmos·Isaac Sim/Lab 시뮬레이션), 다운스트림 정책·배포(ACT/Diffusion Policy 협동로봇, GR00T 휴머노이드, Jetson AGX Thor 엣지)
Physical AI 기술 스택 — 학습(시뮬레이션) · 정책·배포(On-Premise)
IP

지식재산 · 특허

핵심 기술을 특허와 상표로 보호하고 있습니다.

특허 ①PDF 구조좌표·메타데이터 가변포맷 변환 — 핵심특허
특허 ②AI 결과 Reranking Agent 시스템
특허 ③AI 구독형 업데이트 관리 시스템
특허 ④생성 AI·온톨로지 계약서 자동검토 — 핵심특허
특허 출원 4건상표 등록 8건 (Talk·Factory·Vision·Robot 등)

온프레미스 도입을 상담하세요

사내망 환경·GPU 인프라에 맞춰 함께 설계합니다.

도입 문의