검색은 같고, 답변만 다르다 — 온프렘 LLM vs 외부 상용 LLM 실측
「온프렘에서 외부 상용 LLM을 붙이면 일반 온프렘 RAG 대비 검색 품질과 처리 속도가 어떻게 되나」에 답하기 위해, 같은 설치본·같은 문서·같은 질문·같은 프롬프트로 재서 그대로 실었어요.
핵심 세 줄
어떻게 잰 것인가
① 검색 — 두 구성에서 같다
질문마다 사내 임베딩 서버로 질문을 임베딩하고, 의미 검색과 전문 검색을 RRF로 합쳐 상위 4개 조각을 고르는 시간이에요. LLM을 끄고 잰 결과와 켜고 잰 결과의 출처 목록을 나란히 비교했어요.
| 질문 | 정답 페이지 | 상위 4개에 포함 | 순위 | 검색 지연(2회) | LLM 켬/끔 출처 동일 |
|---|---|---|---|---|---|
| 위즈덤베이스에서 브레인이라는 게 무슨 뜻이에요? | start/which | 예 | 1 | 961 / 151ms | 예 |
| 문서 파일을 올려서 5분 안에 브레인을 만들려면 어떻게 하나요? | start/kb-5min | 예 | 1 | 1,908 / 57ms | 예 |
| 문서 없이 빈 페이지에서 바로 글을 쓰기 시작할 수 있나요? | start/blank-site | 예 | 1 | 546 / 156ms | 예 |
| 사내 규정 문서를 모아 두는 브레인 사례가 있나요? | examples/kb | 예 | 1 | 396 / 31ms | 예 |
| 고객에게 공개하는 조립 가이드처럼 외부 공개용으로도 쓸 수 있나요? | examples/site | 예 | 1 | 1,044 / 1,095ms | 예 |
| 그룹·섹션·페이지는 어떻게 다르고 어떻게 정리하나요? | features/pages | 예 | 1 | 710 / 387ms | 예 |
| 페이지에 이미지나 첨부 파일을 넣는 방법은? | features/media | 예 | 1 | 1,146 / 199ms | 예 |
| GitHub 저장소에 푸시하면 자동으로 반영되게 연결할 수 있나요? | features/github | 예 | 1 | 1,410 / 164ms | 예 |
| Claude나 ChatGPT에서 MCP로 브레인을 연결하려면 어떻게 하나요? | features/ai | 예 | 1 | 735 / 45ms | 예 |
| AI 에이전트가 배운 내용을 브레인에 직접 기록할 수 있나요? | features/agent-write | 예 | 1 | 2,874 / 308ms | 예 |
| 우리 홈페이지에 챗봇을 붙이려면 어떻게 하나요? | features/chatbot | 예 | 1 | 1,091 / 196ms | 예 |
| 브레인을 팀원과 함께 쓰고 공개 범위를 정하는 방법은? | features/visibility | 예 | 1 | 1,890 / 79ms | 예 |
| 연차는 며칠인가요? | imported/연차-휴가-규정 | 예 | 1 | 1,311 / 100ms | 예 |
정답 페이지가 상위 4개에 든 비율 13/13 · 1위 13/13 · 검색 지연 평균 1,232ms(중앙값 1,091 · 최소 396 · 최대 2,874) — 이 중 질문 임베딩 1,223ms, 전문 검색 9ms
② 답변 지연 — 여기서만 차이가 난다
같은 프롬프트(질문 + 발췌)를 받아 4문장 이내 답을 쓰기까지의 시간이에요. 사내 경량 LLM 수치는 GPU 없는 노트북 가상 서버의 CPU만으로 구동한 값이라 참고용이에요 — CPU라서 이 속도이고, 국산 LLM 팩·사내 vLLM은 GPU 서버 구동이 표준 구성이라 GPU를 붙이면 답변 속도와 쓸 수 있는 모델 크기(표준 8B 팩)가 함께 올라가요.
| LLM | 어디서 | 중앙값 | 평균 | 최소 | 최대 | 실패·발췌 폴백 |
|---|---|---|---|---|---|---|
| Kanana 1.5 2.1B(국산 경량 팩 · GPU 없는 CPU · 참고값) | 사내 · GPU 없는 CPU(참고) | 41.6초 | 47.4초 | 10.3초 | 98.4초 | 0 / 13 |
| OpenAI GPT-5.4 mini | 외부 상용(API) | 1.5초 | 1.8초 | 1.2초 | 5.5초 | 0 / 26 |
| Anthropic Claude Sonnet 5 | 외부 상용(API) | 3.0초 | 3.0초 | 2.1초 | 4.3초 | 0 / 26 |
| Google Gemini 3.8 Flash | 외부 상용(API) | 3.6초 | 3.6초 | 2.5초 | 8.1초 | 0 / 26 |
| Upstage Solar Pro 4 | 외부 상용(API) | 2.9초 | 3.5초 | 1.3초 | 11.3초 | 0 / 26 |
| Qwen 3.8 Flash(비즈라우터 국내 GPU) | 외부 상용(API) | 4.9초 | 9.9초 | 1.5초 | 36.6초 | 0 / 26 |
③ 답변 문장 품질(자동 채점 · 참고용)
심사 모델(Claude Sonnet 5)이 「발췌에 없는 내용을 지어내지 않았나(근거 충실)」 「질문에 실제로 답했나(유용성)」를 1~5점으로 채점했어요. 자동 채점은 참고용이고, 아래 표본 답변을 직접 읽어 보시길 권해요. 사내 경량 팩 점수는 CPU에서 돌린 2.1B 모델 기준이라, GPU에서 표준 8B 팩을 쓰면 달라져요.
| LLM | 근거 충실(1~5) | 유용성(1~5) | 답변 평균 토큰 |
|---|---|---|---|
| Kanana 1.5 2.1B(국산 경량 팩 · GPU 없는 CPU · 참고값) | 3.0 | 2.8 | — |
| OpenAI GPT-5.4 mini | 5.0 | 4.8 | 93 |
| Anthropic Claude Sonnet 5 | 5.0 | 4.9 | 213 |
| Google Gemini 3.8 Flash | 4.9 | 4.8 | 73 |
| Upstage Solar Pro 4 | 4.9 | 4.9 | 84 |
| Qwen 3.8 Flash(비즈라우터 국내 GPU) | 5.0 | 4.8 | 347 |
④ 표본 답변 — 같은 질문, 같은 발췌
질문 3개를 골라 사내 LLM과 외부 LLM의 답변을 그대로 실었어요. 나머지 질문도 같은 방식으로 잰 값이 위 표에 들어 있어요.
위즈덤베이스에서 브레인이라는 게 무슨 뜻이에요?
검색된 출처(두 구성 동일): start/which · faq/faq · examples/kb · features/github
위즈덤베이스에서 "브레인"이란, 회사의 규정, 매뉴얼, 노하우 등 다양한 지식(위즈덤)을 한 곳에 모아두고 관리하는 시스템을 의미해요. 즉, 흩어진 문서들을 모아 기억하기 쉽고, 필요할 때 바로 찾을 수 있게 정리해둔 '두 번째 뇌' 같은 역할을 하는 것이 브레인입니다. 문서 사이트와 AI를 연결해 정보를 쉽게 제공한다는 점에서, 회사가 지식을 효과적으로 공유하고 관리할 수 있도록 도와주는 도구라고 할 수 있어요.
위즈덤베이스에서 브레인은 문서를 모아 두고, AI에 연결해서 답하게 하는 관리 단위예요. 문서에서는 브레인을 “관리하고 AI에 연결하는 단위”라고 설명하고 있어요. 사람이 읽는 화면은 문서 사이트라고 따로 부른다고 해요.
안녕하세요! 위즈덤베이스에서 브레인이 뭔지 알려드릴게요 😊 회사 안에는 규정, 매뉴얼, 노하우 같은 지혜(위즈덤)가 여기저기 문서로 흩어져 있는데, 정작 필요할 때는 못 찾는 경우가 많죠. 브레인은 이렇게 흩어진 문서들을 한 곳에 모아서 관리하고 AI에 연결하는 단위예요. 한번 브레인에 문서를 넣어두면, 아무리 많은 문서라도 통째로 기억하고, 검색창에 낱말만 쳐도 바로 찾아주고, ChatGPT나 Claude 같은 AI 도구가 그 문서를 근거로 대신 답해줘요. 참고로 사람이 읽는 화면은 문서 사이트라고 따로 불러요.
문서 파일을 올려서 5분 안에 브레인을 만들려면 어떻게 하나요?
검색된 출처(두 구성 동일): start/kb-5min · start/which · faq/faq · features/github
문서 파일을 5분 안에 브레인을 만들려면, 채우기 방식에서 문서로부터 만들기를 선택한 뒤 파일(한글, PDF, 워드 등)을 끌어다 놓거나, 파일을 업로드하면 돼요. 문서가 많으면 ZIP으로 묶어 올려도 돼요. 이미 웹사이트 주소가 있다면 그걸 붙여 넣어도 되고, 아직 만들지 않았다면 빈 페이지에서 직접 쓰기로 시작할 수 있어요. 문서를 올린 뒤에는 편집 화면 왼쪽 위의 문서 가져오기에서 언제든 추가/수정할 수 있어요. 어떤 방식으로 시작하든 전부 같은 브레인이 만들어져요. 감이 잘 안 온다면 대시보드의 예시 브레인을 받아 직접 수정해 볼 수도 있어요.
문서 파일로 5분 안에 브레인을 만들려면, 따라하기: 5분 만에 브레인 만들기 > 2. 문서 올리기에서 채우기 방식에서 문서로부터 만들기를 고르고 파일을 올리면 돼요. 한글(HWP), PDF, 워드, 엑셀, PPT, 스캔 이미지도 올릴 수 있고, 문서가 많으면 ZIP으로 묶어 한 번에 올릴 수 있어요. 문서가 아직 없다면 직접 만들기를 고르면 돼요.
채우기 방식에서 문서로부터 만들기를 고르고 파일을 올리면 돼요. 한글(HWP)·PDF·워드·엑셀·PPT·스캔 이미지까지 정리 안 된 그대로 올려도 괜찮아요. 문서가 많으면 ZIP 하나로 묶어서 올리면 알아서 나눠 변환해주고, ZIP은 한 번에 2,000개까지 올릴 수 있어요. 파일을 끌어다 놓기만 하면 되니 정말 간단해요!
문서 없이 빈 페이지에서 바로 글을 쓰기 시작할 수 있나요?
검색된 출처(두 구성 동일): start/blank-site · start/which · faq/faq · features/pages
문서에서 찾지 못했어요. 직접 글을 쓰기 시작하는 방법에 대한 정보는 없어요.
네, 가능해요. 문서를 올릴 게 없어도 새로 만들기로 시작해서 빈 페이지에서 직접 쓸 수 있어요. 문서에 따르면 시작만 다를 뿐, 나중에 문서를 올리는 것도 가능해요.
네, 가능해요! 이용 가이드나 고객 안내처럼 직접 써서 보여 주는 문서도 새로 만들기로 시작하면 돼요, 그냥 올릴 문서가 없을 뿐이에요. 나중에 마음이 바뀌면 편집 화면 왼쪽 위 문서 가져오기에서 언제든 문서를 올릴 수도 있어요. 감이 잘 안 잡히면 대시보드에서 예시 브레인을 받아서 직접 눌러 보는 것도 좋아요.
⑤ 외부 LLM으로 나가는 것 — 요청 본문 실물
외부 상용 LLM을 붙였을 때 실제로 제공사에 전송되는 요청 본문 한 건이에요(1,229자). 질문과 검색된 발췌만 있고, 문서 원본·임베딩·색인·사용자 정보는 없어요. 발췌 상한은 관리자가 정해요(기본 4,800자).
요청 본문 펼치기
{
"model": "<답변 모델>",
"messages": [
{
"role": "user",
"content": "너는 「위즈덤베이스 도움말」의 문서를 근거로 답하는 도우미야.\n아래 문서 발췌만 근거로 삼아 친절하게 답해. 답하는 언어는 질문의 언어를 따라(한국어 질문엔 한국어로 — 토스처럼 쉬운 말(해요체), 영어 질문엔 영어로).\n발췌에 없는 내용은 지어내지 말고 \"문서에서 찾지 못했어요\"라고 말해. 답은 4문장 이내로 간결하게.\n\n[질문]\n위즈덤베이스에서 브레인이라는 게 무슨 뜻이에요?\n\n[문서 발췌]\n[브레인이 뭔가요?]\n브레인이 뭔가요? > 왜 「브레인」인가요\n일 잘하는 사람은 머릿속에만 의지하지 않아요. 메모와 문서라는 두 번째 뇌 에 지식을 옮겨 두고, 필요할 때 꺼내 쓰죠. 회사도 똑같아요 — 규정, 매뉴얼, 노하우 같은 지혜(위즈덤)는 이미 문서 곳곳에 흩어져 있는데, 정작 필요한 순간에는 아무도 못 찾아요. 위즈덤베이스는 그 흩어진 문서를 모아 브레인 으로 만들어요. 한번 넣어 두면: 기억해요 — 문서가 몇백 페이지여도 통째로 기억해요. 찾아 줘요 — 문서 사이트 검색창에 낱말만 쳐도 바로 찾아요. 대신 답해요 — ChatGPT·Claude 같은 AI 도구와 홈페이지 챗봇이 우리 문서를 근거로 답해요. 그래서 사람이 보면 잘 정리된 문서 사이트 고, AI에게는 회사를 통째로 아는 세컨드 브레인 이에요. 위즈덤베이스에서는 이 둘을 브레인 (관리하고 AI에 연결하는 단위)과 문서 사이트 (그걸 사람이 읽는 화면)라고 불러요. 처음 로그인하면 보이는 화면 — 예시를 구경하거나, 바로 만들면 돼요.\n\n---\n\n[자주 묻는 질문]\n자주 묻는 질문 > Q. 예시 브레인은 어떻게 받나요?\n브레인이 하나도 없을 때 대시보드에 예시 브레인 받기 버튼이 보여요. 가상 회사 「오름가구」의 문서가 채워진 브레인을 통째로 받아서, 검색하고 고치고 AI에 연결해 볼 수 있어요. 다 보면 설정 탭에서 지우면 돼요.\n\n---\n\n[사례: 사내 브레인 「오름가구」]\n사례: 사내 브레인 「오름가구」 > 누가 무엇을 보는지도 보여요\n통계 탭에서 방문 추이와 많이 본 페이지를 볼 수 있어요. 사내 브레인이라면 「어떤 규정을 다들 계속 찾아보는지」가 그대로 드러나요. 통계 탭 — 방문 추이와 많이 본 페이지를 보여 줘요.\n\n---\n\n[GitHub 저장소 연결 — 푸시하면 자동 반영]\n 있어요). 양방향으로 쓰려면 기본은 GitHub → 위즈덤베이스 한쪽 이에요. 저장소가 정본이라, 동기화되는 페이지를 여기서 고치면 다음 동기화 때 저장소 내용으로 되돌아가요(편집 화면 위에 안내가 보여요). Gi"
}
],
"max_tokens": 1200
}읽을 때 유의할 점
- 사내 LLM 수치는 노트북 위 가상 서버(GPU 없음 · 다른 작업과 CPU 공유)에서 CPU만으로 돌린 참고값이에요. CPU라서 나온 속도이고, GPU 서버에서는 같은 2.1B 모델도 수 초대가 되며 표준 8B 팩까지 쓸 수 있어요. 국산 LLM 팩·사내 vLLM은 GPU 서버 구동이 표준 구성이에요.
- 외부 LLM 지연은 서울 노트북에서 OpenAI 호환 게이트웨이를 거쳐 잰 값으로, 기관 회선·프록시·제공사 혼잡에 따라 달라져요.
- 문장 품질 점수는 LLM 자동 채점이라 참고용이에요. 표본 답변을 직접 읽어 판단하시길 권해요.
- 검색 품질 자체(정답 페이지 적중)는 문서·질문 구성에 따라 달라지므로, 기관 문서로 체험 라이선스 안에서 직접 재 보시는 것을 권해요. 체험은 30일·50석·카드 없음이에요.
기관 문서로 직접 재 보세요
체험 라이선스로 설치한 뒤 관리 › 온프렘에서 사내 LLM과 외부 상용 LLM을 바꿔 가며 같은 질문을 던져 보면, 이 자료와 같은 방식으로 비교할 수 있어요.
