【企业与高校轻量私有化RAG知识库检索与文档智能问答系统】基于 Vue3 + Spring Boot + 本地向量模型与切片召回重排 的设计与实现(含PRD/三端高保真源码/大屏)
📌 项目摘要:在通用大模型落地产业的浪潮中,企业内部核心文书、商业机密与高校科研院所未公开实验数据的外泄风险,使得公有云大模型难以直接进入核心生产环节。同时,大模型“知识幻觉”严重阻碍了专业文档检索答疑的准确性。本项目研发了一套基于 Vue 3.4 + Pinia + Tailwind CSS + ECharts 5 + Spring Boot 3.2 + Milvus/Chroma 本地向量检索 + BM25 稀疏全文检索 + Bge-Reranker 交叉重排 + 本地 Ollama/DeepSeek 私有化大模型推理 的企业与高校轻量级私有化 RAG 知识库问答中枢。实现了“多模态文档智能解析与语义切片 + 稠密与稀疏双路高命中召回 + 溯源级切片定位高亮 + 细粒度 Token 消耗审计与多租户隔离”,打造“PC 端智能检索与问答驾驶舱 + Admin 模型网关与切片治理中台 + Mobile 随身科研对练助手”三位一体全栈数字解决方案!
一、 系统业务拓扑与 RAG 检索生成全景架构
系统围绕“数据不出本地、零幻觉溯源、毫秒级响应”三大核心指标,构建了完整的全栈协同闭环:
+-----------------------------------------------------------------------------------+
| 企业与高校轻量私有化 RAG 检索增强生成与智能问答中枢 |
+-----------------------------------------------------------------------------------+
| |
| [PC端用户检索中枢] [Admin治理与算力中台] [Mobile随身移动助手] |
| * RAG 运行综合态势驾驶舱 * 全景算力调度与运营监控 * 移动知识门户首页 |
| * 多模态文档解析切片注入台 * 多租户知识库隔离与配置 * 沉浸式流式对话问答 |
| * 稠密与稀疏混合检索诊断器 * 本地模型网关连接池调度 * 会议纪要拍照切片上传|
| * 流式推理问答 Studio 抽屉 * 切片审计与脏向量清洗工具 * 个人知识片段离线收藏|
| * RAG 问答质量评估指标矩阵 * 租户 Token 消耗与算力账单 (390x844 极简交互) |
| (1440x960 极客 Indigo 科技蓝) (经典中后台运维与算力治理) |
| |
+-----------------------------------------------------------------------------------+
二、 PC 端:智能检索与问答驾驶舱(1440x960 视口)
PC 客户端专为企业知识工程师、高校科研骨干打造,采用 Tech Indigo(深邃靛蓝)、Cyan(极客青)与 Slate(工业冷灰) 配色体系:
1. RAG 综合运行指标与态势大屏
实时呈现向量库切片总量、平均检索延迟(38ms)、向量空间聚类分布及热门问答主题气泡图。 !企业知识中枢综合大屏
2. 多模态智能切片解析与注入工作台
支持 PDF、DOCX、Markdown、Excel 等格式,可自由配置固定长度切片、自然段落切片与语义边界滑动窗口切片,实时观察 Token 分词效果。 !多模态智能切片解析工作台
3. 混合检索与重排对比诊断器
可视化展示 Dense 向量语义相似度打分与 Sparse BM25 关键字打分的差异,并直观呈现 Cross-Encoder 交叉重排后的最终 Top-K 排序变迁。 !混合检索与重排对比诊断器
4. 流式推理问答 Studio 与溯源抽屉
支持 SSE 打字机渐进式生成,回答中内嵌高亮引用角标(如 [1], [2]),点击右侧一键滑出原文切片段落、页码及余弦相似度。 !流式推理问答Studio
5. RAG 问答质量评估指标矩阵
引入 Ragas 工业级评测体系,全面量化监控忠实度(Faithfulness)、答案相关度(Answer Relevance)及上下文召回率(Context Recall)。 !RAG问答质量评估指标矩阵
三、 Admin 治理运维与算力审计中台(1440x960 视口)
1. 全局算力调度与运营监控大盘
监控本地私有化 GPU 显存负载(Nvidia A10/4090 水位)、并发推理队列深度及每日吞吐趋势。 !后台全局算力调度监控
2. 多租户知识库隔离与权限管控
支持按部门、实验室与研发课题组实现严格的元数据逻辑隔离,可独立挂载不同嵌入模型与维度。 !多租户知识库隔离配置
3. 模型网关与本地 LLM 连接池配置
配置 Ollama、vLLM 与 LMStudio 本地服务地址,支持 DeepSeek-R1、Qwen2.5 等模型的无缝切换与负载均衡。 !模型网关与本地LLM连接池
4. 切片审计与脏向量清洗中心
检索偏离度过高的异常离散切片,支持知识工程师在线手工修订原文、禁用切片并触发异步重新向量化。 !切片审计与脏向量清洗中心
5. 租户 Token 消耗统计与算力账单
精确计量各部门与课题组的输入/输出 Token 消耗、生成时间与算力分摊成本,支持账单按周期对账导出。 !租户Token消耗统计与算力账单
四、 Mobile 移动端随身助理体验(390x844 视口)
手机端适配移动办公与科研文献随时速查需求:
| 移动知识门户 | 沉浸式流式对话 | 随手拍文档上传 | 个人知识收藏 |
|---|---|---|---|
| ! | ! | ! | ! |
五、 后端核心工程实现(Spring Boot 3.2 架构)
// Spring Boot 3.2 企业与高校轻量级 RAG 检索问答中枢
@RestController
@RequestMapping("/api/v1/rag")
@Tag(name = "LightRagPipelineController", description = "混合检索召回、Cross-Encoder重排与流式问答核心控制器")
public class LightRagPipelineController {
@Autowired
private HybridRetrievalService retrievalService;
@Autowired
private BgeRerankerService rerankerService;
@Autowired
private LocalOllamaStreamService llmService;
@Autowired
private CitationTracebackService citationService;
@PostMapping(value = "/chat/stream", produces = MediaType.TEXT_EVENT_STREAM_VALUE)
@Operation(summary = "流式多路召回与重排问答生成(携带切片置信度与溯源锚点)")
public SseEmitter streamRagInquiry(@Valid @RequestBody RagQueryDTO queryDTO) {
SseEmitter emitter = new SseEmitter(60000L);
// 1. 稠密向量检索 (Milvus/Chroma) + 稀疏BM25全文检索 (Elasticsearch)
List<DocumentChunkVO> candidateChunks = retrievalService.hybridRetrieve(queryDTO);
// 2. BGE-Reranker-Large 交叉重排,过滤 Top-K 核心召回源
List<DocumentChunkVO> rerankedChunks = rerankerService.rerank(queryDTO.getQuery(), candidateChunks, 5);
// 3. 构建带防护注入校验的 Context 提示词,通过 Ollama/DeepSeek 本地流式推理
llmService.streamInference(emitter, queryDTO.getQuery(), rerankedChunks);
return emitter;
}
@PostMapping("/documents/ingest")
@Operation(summary = "多格式文档解析、语义切片与向量持久化管道")
public ResponseEntity<ApiResponse<IngestResultVO>> ingestDocument(
@RequestParam("file") MultipartFile file,
@RequestParam("kbId") String kbId,
@RequestParam(defaultValue = "recursive_semantic") String chunkStrategy) {
IngestResultVO vo = retrievalService.executeIngestionPipeline(file, kbId, chunkStrategy);
return ResponseEntity.ok(ApiResponse.success(vo));
}
}
六、 总结与源码工程获取
本项目真正实现了“数据不离域、模型全私有、答案可溯源、成本可量化”的企业级 RAG 闭环。
完整三端高保真前端源码、PRD需求规格说明书及架构设计文档,可访问官方发布页获取:【企业与高校轻量私有化RAG知识库检索与文档智能问答系统】基于 Vue3 + Spring Boot + 本地向量模型与切片召回重排 的设计与实现(含PRD/三端高保真源码/大屏)