Search is identical, only answers differ — on-prem LLM vs. external commercial LLM
To answer "how do search quality and speed compare when an on-prem deployment uses an external commercial LLM", we measured the same install, documents, questions and prompt and published the results as they are.
Three takeaways
How it was measured
① Retrieval — identical in both setups
Per question: embed the query on the on-site embedding server, merge semantic and full-text results with RRF and pick the top 4 chunks. The source lists with the LLM off and on are compared side by side.
| Question | Correct page | In top 4 | Rank | Retrieval latency (2 runs) | Same sources LLM on/off |
|---|---|---|---|---|---|
| 위즈덤베이스에서 브레인이라는 게 무슨 뜻이에요? | start/which | Yes | 1 | 961 / 151ms | Yes |
| 문서 파일을 올려서 5분 안에 브레인을 만들려면 어떻게 하나요? | start/kb-5min | Yes | 1 | 1,908 / 57ms | Yes |
| 문서 없이 빈 페이지에서 바로 글을 쓰기 시작할 수 있나요? | start/blank-site | Yes | 1 | 546 / 156ms | Yes |
| 사내 규정 문서를 모아 두는 브레인 사례가 있나요? | examples/kb | Yes | 1 | 396 / 31ms | Yes |
| 고객에게 공개하는 조립 가이드처럼 외부 공개용으로도 쓸 수 있나요? | examples/site | Yes | 1 | 1,044 / 1,095ms | Yes |
| 그룹·섹션·페이지는 어떻게 다르고 어떻게 정리하나요? | features/pages | Yes | 1 | 710 / 387ms | Yes |
| 페이지에 이미지나 첨부 파일을 넣는 방법은? | features/media | Yes | 1 | 1,146 / 199ms | Yes |
| GitHub 저장소에 푸시하면 자동으로 반영되게 연결할 수 있나요? | features/github | Yes | 1 | 1,410 / 164ms | Yes |
| Claude나 ChatGPT에서 MCP로 브레인을 연결하려면 어떻게 하나요? | features/ai | Yes | 1 | 735 / 45ms | Yes |
| AI 에이전트가 배운 내용을 브레인에 직접 기록할 수 있나요? | features/agent-write | Yes | 1 | 2,874 / 308ms | Yes |
| 우리 홈페이지에 챗봇을 붙이려면 어떻게 하나요? | features/chatbot | Yes | 1 | 1,091 / 196ms | Yes |
| 브레인을 팀원과 함께 쓰고 공개 범위를 정하는 방법은? | features/visibility | Yes | 1 | 1,890 / 79ms | Yes |
| 연차는 며칠인가요? | imported/연차-휴가-규정 | Yes | 1 | 1,311 / 100ms | Yes |
Correct page in top 4: 13/13 · rank 1: 13/13 · retrieval latency avg 1,232ms (median 1,091 · min 396 · max 2,874) — of which query embedding 1,223ms, full-text 9ms
② Answer latency — the only place they differ
Time to write an answer of up to 4 sentences from the same prompt (question + excerpts). The internal lightweight LLM figure is a reference value from a laptop VM running on CPU only — the standard setup for Korean LLM packs and internal vLLM is a GPU server, which raises both answer speed and the model size you can run (standard 8B pack).
| LLM | Where | Median | Average | Min | Max | Failures · excerpt fallback |
|---|---|---|---|---|---|---|
| Kanana 1.5 2.1B(국산 경량 팩 · GPU 없는 CPU · 참고값) | On-site · CPU only, no GPU (reference) | 41.6s | 47.4s | 10.3s | 98.4s | 0 / 13 |
| OpenAI GPT-5.4 mini | External (API) | 1.5s | 1.8s | 1.2s | 5.5s | 0 / 26 |
| Anthropic Claude Sonnet 5 | External (API) | 3.0s | 3.0s | 2.1s | 4.3s | 0 / 26 |
| Google Gemini 3.8 Flash | External (API) | 3.6s | 3.6s | 2.5s | 8.1s | 0 / 26 |
| Upstage Solar Pro 4 | External (API) | 2.9s | 3.5s | 1.3s | 11.3s | 0 / 26 |
| Qwen 3.8 Flash(비즈라우터 국내 GPU) | External (API) | 4.9s | 9.9s | 1.5s | 36.6s | 0 / 26 |
③ Answer wording quality (automated scoring · for reference)
A judge model (Claude Sonnet 5) scored "no content invented beyond the excerpts (faithfulness)" and "actually answers the question (helpfulness)" from 1 to 5. Automated scores are a reference only; please read the samples below. The internal pack score reflects the 2.1B model on CPU and changes with the standard 8B pack on a GPU.
| LLM | Faithfulness (1–5) | Helpfulness (1–5) | Avg. answer tokens |
|---|---|---|---|
| Kanana 1.5 2.1B(국산 경량 팩 · GPU 없는 CPU · 참고값) | 3.0 | 2.8 | — |
| OpenAI GPT-5.4 mini | 5.0 | 4.8 | 93 |
| Anthropic Claude Sonnet 5 | 5.0 | 4.9 | 213 |
| Google Gemini 3.8 Flash | 4.9 | 4.8 | 73 |
| Upstage Solar Pro 4 | 4.9 | 4.9 | 84 |
| Qwen 3.8 Flash(비즈라우터 국내 GPU) | 5.0 | 4.8 | 347 |
④ Sample answers — same question, same excerpts
3 questions with the internal and external answers verbatim. The remaining questions were measured the same way and are in the tables above.
위즈덤베이스에서 브레인이라는 게 무슨 뜻이에요?
Retrieved sources (identical in both setups): start/which · faq/faq · examples/kb · features/github
위즈덤베이스에서 "브레인"이란, 회사의 규정, 매뉴얼, 노하우 등 다양한 지식(위즈덤)을 한 곳에 모아두고 관리하는 시스템을 의미해요. 즉, 흩어진 문서들을 모아 기억하기 쉽고, 필요할 때 바로 찾을 수 있게 정리해둔 '두 번째 뇌' 같은 역할을 하는 것이 브레인입니다. 문서 사이트와 AI를 연결해 정보를 쉽게 제공한다는 점에서, 회사가 지식을 효과적으로 공유하고 관리할 수 있도록 도와주는 도구라고 할 수 있어요.
위즈덤베이스에서 브레인은 문서를 모아 두고, AI에 연결해서 답하게 하는 관리 단위예요. 문서에서는 브레인을 “관리하고 AI에 연결하는 단위”라고 설명하고 있어요. 사람이 읽는 화면은 문서 사이트라고 따로 부른다고 해요.
안녕하세요! 위즈덤베이스에서 브레인이 뭔지 알려드릴게요 😊 회사 안에는 규정, 매뉴얼, 노하우 같은 지혜(위즈덤)가 여기저기 문서로 흩어져 있는데, 정작 필요할 때는 못 찾는 경우가 많죠. 브레인은 이렇게 흩어진 문서들을 한 곳에 모아서 관리하고 AI에 연결하는 단위예요. 한번 브레인에 문서를 넣어두면, 아무리 많은 문서라도 통째로 기억하고, 검색창에 낱말만 쳐도 바로 찾아주고, ChatGPT나 Claude 같은 AI 도구가 그 문서를 근거로 대신 답해줘요. 참고로 사람이 읽는 화면은 문서 사이트라고 따로 불러요.
문서 파일을 올려서 5분 안에 브레인을 만들려면 어떻게 하나요?
Retrieved sources (identical in both setups): start/kb-5min · start/which · faq/faq · features/github
문서 파일을 5분 안에 브레인을 만들려면, 채우기 방식에서 문서로부터 만들기를 선택한 뒤 파일(한글, PDF, 워드 등)을 끌어다 놓거나, 파일을 업로드하면 돼요. 문서가 많으면 ZIP으로 묶어 올려도 돼요. 이미 웹사이트 주소가 있다면 그걸 붙여 넣어도 되고, 아직 만들지 않았다면 빈 페이지에서 직접 쓰기로 시작할 수 있어요. 문서를 올린 뒤에는 편집 화면 왼쪽 위의 문서 가져오기에서 언제든 추가/수정할 수 있어요. 어떤 방식으로 시작하든 전부 같은 브레인이 만들어져요. 감이 잘 안 온다면 대시보드의 예시 브레인을 받아 직접 수정해 볼 수도 있어요.
문서 파일로 5분 안에 브레인을 만들려면, 따라하기: 5분 만에 브레인 만들기 > 2. 문서 올리기에서 채우기 방식에서 문서로부터 만들기를 고르고 파일을 올리면 돼요. 한글(HWP), PDF, 워드, 엑셀, PPT, 스캔 이미지도 올릴 수 있고, 문서가 많으면 ZIP으로 묶어 한 번에 올릴 수 있어요. 문서가 아직 없다면 직접 만들기를 고르면 돼요.
채우기 방식에서 문서로부터 만들기를 고르고 파일을 올리면 돼요. 한글(HWP)·PDF·워드·엑셀·PPT·스캔 이미지까지 정리 안 된 그대로 올려도 괜찮아요. 문서가 많으면 ZIP 하나로 묶어서 올리면 알아서 나눠 변환해주고, ZIP은 한 번에 2,000개까지 올릴 수 있어요. 파일을 끌어다 놓기만 하면 되니 정말 간단해요!
문서 없이 빈 페이지에서 바로 글을 쓰기 시작할 수 있나요?
Retrieved sources (identical in both setups): start/blank-site · start/which · faq/faq · features/pages
문서에서 찾지 못했어요. 직접 글을 쓰기 시작하는 방법에 대한 정보는 없어요.
네, 가능해요. 문서를 올릴 게 없어도 새로 만들기로 시작해서 빈 페이지에서 직접 쓸 수 있어요. 문서에 따르면 시작만 다를 뿐, 나중에 문서를 올리는 것도 가능해요.
네, 가능해요! 이용 가이드나 고객 안내처럼 직접 써서 보여 주는 문서도 새로 만들기로 시작하면 돼요, 그냥 올릴 문서가 없을 뿐이에요. 나중에 마음이 바뀌면 편집 화면 왼쪽 위 문서 가져오기에서 언제든 문서를 올릴 수도 있어요. 감이 잘 안 잡히면 대시보드에서 예시 브레인을 받아서 직접 눌러 보는 것도 좋아요.
⑤ What leaves for the external LLM — an actual request body
One real request body sent to the provider when an external LLM is attached (1,229 characters). Only the question and the retrieved excerpts — no source documents, embeddings, index or user data. Admins set the excerpt cap (default 4,800).
Show request body
{
"model": "<답변 모델>",
"messages": [
{
"role": "user",
"content": "너는 「위즈덤베이스 도움말」의 문서를 근거로 답하는 도우미야.\n아래 문서 발췌만 근거로 삼아 친절하게 답해. 답하는 언어는 질문의 언어를 따라(한국어 질문엔 한국어로 — 토스처럼 쉬운 말(해요체), 영어 질문엔 영어로).\n발췌에 없는 내용은 지어내지 말고 \"문서에서 찾지 못했어요\"라고 말해. 답은 4문장 이내로 간결하게.\n\n[질문]\n위즈덤베이스에서 브레인이라는 게 무슨 뜻이에요?\n\n[문서 발췌]\n[브레인이 뭔가요?]\n브레인이 뭔가요? > 왜 「브레인」인가요\n일 잘하는 사람은 머릿속에만 의지하지 않아요. 메모와 문서라는 두 번째 뇌 에 지식을 옮겨 두고, 필요할 때 꺼내 쓰죠. 회사도 똑같아요 — 규정, 매뉴얼, 노하우 같은 지혜(위즈덤)는 이미 문서 곳곳에 흩어져 있는데, 정작 필요한 순간에는 아무도 못 찾아요. 위즈덤베이스는 그 흩어진 문서를 모아 브레인 으로 만들어요. 한번 넣어 두면: 기억해요 — 문서가 몇백 페이지여도 통째로 기억해요. 찾아 줘요 — 문서 사이트 검색창에 낱말만 쳐도 바로 찾아요. 대신 답해요 — ChatGPT·Claude 같은 AI 도구와 홈페이지 챗봇이 우리 문서를 근거로 답해요. 그래서 사람이 보면 잘 정리된 문서 사이트 고, AI에게는 회사를 통째로 아는 세컨드 브레인 이에요. 위즈덤베이스에서는 이 둘을 브레인 (관리하고 AI에 연결하는 단위)과 문서 사이트 (그걸 사람이 읽는 화면)라고 불러요. 처음 로그인하면 보이는 화면 — 예시를 구경하거나, 바로 만들면 돼요.\n\n---\n\n[자주 묻는 질문]\n자주 묻는 질문 > Q. 예시 브레인은 어떻게 받나요?\n브레인이 하나도 없을 때 대시보드에 예시 브레인 받기 버튼이 보여요. 가상 회사 「오름가구」의 문서가 채워진 브레인을 통째로 받아서, 검색하고 고치고 AI에 연결해 볼 수 있어요. 다 보면 설정 탭에서 지우면 돼요.\n\n---\n\n[사례: 사내 브레인 「오름가구」]\n사례: 사내 브레인 「오름가구」 > 누가 무엇을 보는지도 보여요\n통계 탭에서 방문 추이와 많이 본 페이지를 볼 수 있어요. 사내 브레인이라면 「어떤 규정을 다들 계속 찾아보는지」가 그대로 드러나요. 통계 탭 — 방문 추이와 많이 본 페이지를 보여 줘요.\n\n---\n\n[GitHub 저장소 연결 — 푸시하면 자동 반영]\n 있어요). 양방향으로 쓰려면 기본은 GitHub → 위즈덤베이스 한쪽 이에요. 저장소가 정본이라, 동기화되는 페이지를 여기서 고치면 다음 동기화 때 저장소 내용으로 되돌아가요(편집 화면 위에 안내가 보여요). Gi"
}
],
"max_tokens": 1200
}Caveats
- Internal LLM figures are CPU-only reference values from a VM on a laptop (no GPU, CPU shared with other work). They are what CPU-only delivers; on a GPU server the same 2.1B model answers in seconds and the standard 8B pack becomes usable. GPU servers are the standard setup for Korean LLM packs and internal vLLM.
- External LLM latency was measured from a laptop in Seoul through an OpenAI-compatible gateway and varies with your network, proxies and provider load.
- Wording scores are automated LLM judgements — a reference only. Please read the samples yourself.
- Retrieval quality (correct-page hits) depends on your documents and questions; we recommend measuring with your own documents within the trial license (30 days · 50 seats · no card).
Measure with your own documents
Install with a trial license, then switch between an internal and an external LLM under Admin › On-prem and ask the same questions — you can compare exactly as in this page.
