온프레미스 멀티에이전트
RAG 아키텍처
범용 LLM 클라우드 호출이 아니라, 사내 데이터로 학습한 자사 sLLM과 멀티에이전트로 동작합니다. 모든 모델과 데이터가 고객사 사내망에서 완전히 격리되어 운영되며, 범용 LLM 대비 비용을 약 1/10 수준으로 낮춥니다.
기술 스택
검색 · 지식 (RAG)
Search Engine · Vector DB · PDF Parser(핵심특허)에 Reranking Agent(특허)를 더해 검색 정확도를 높이고, 사내 문서를 학습(Sphinx X)·인덱싱합니다.
에이전트 · 실행
멀티에이전트 오케스트레이션과 Tool Call로 검색·작성·검증을 수행합니다. Comment System(문장 Type 추천·PDF Layer Markup)과 원문 인용으로 환각을 방지하고 권한·보안 레벨별로 답변합니다.
모델 · 서빙
자사 sLLM 파인튜닝과 vLLM On-Prem 서빙. 사내망 완전 격리로 비용을 크게 낮추고 특정 벤더에 종속되지 않습니다.
Physical · 학습·배포
학습은 시뮬레이션(NVIDIA Cosmos·Isaac Sim/Lab), 배포는 On-Premise(Jetson Thor). Digital Twin과 단일작업 모방학습으로 산업 신뢰성을 확보합니다.
동작 원리 — On-Premise 멀티에이전트 RAG
이해 → 추론·계획 → 실행 → 근거·신뢰 → 서빙을 하나의 온프레미스 파이프라인으로 연결합니다.
모델 · 서빙 라인업
업무에 맞는 모델을 선택·파인튜닝해 온프레미스 vLLM으로 서빙합니다.
왜 온프레미스 자사 sLLM 인가
부서 요구사항을 먼저 분석해 소형 언어모델(sLLM)을 도입하는 Bottom-Up 전략으로, 변화에 유연하고 현장 정확도가 높습니다.
완전 격리
문서·소스코드가 외부로 전송되지 않고 폐쇄망에서도 운영됩니다. 클라우드 불가 시장을 선점합니다.
비용 1/10
사내망 격리 운영으로 외부 API 비용이 없어 범용 LLM 대비 도입·운영 비용을 크게 낮춥니다.
Lock-in 방지
특정 벤더에 종속되지 않고 도메인 데이터를 직접 소유합니다. Talk↔Factory↔Robot 통합 생태계로 확장됩니다.
학습은 시뮬레이션, 배포는 On-Premise
범용 VLA(연구 신뢰도 60~80%)는 소규모팀·산업현장에 부적합 → 단일작업 모방학습으로 99%대 산업 신뢰성을 확보합니다.
지식재산 · 특허
핵심 기술을 특허와 상표로 보호하고 있습니다.