建企業(yè)知識(shí)庫問答系統(tǒng)實(shí)戰(zhàn))
之前在給一家企業(yè)做內(nèi)部知識(shí)庫時(shí)最頭疼的問題不是文檔存儲(chǔ)而是“用戶問一句自然語言系統(tǒng)能不能找到真正相關(guān)的文檔”。最初用 MySQL 的 LIKE 模糊匹配只能命中關(guān)鍵詞用戶問“差旅報(bào)銷怎么走流程”而文檔里寫的是“申請(qǐng)差旅費(fèi)用需要提交審批單”這種語義上的差異直接導(dǎo)致檢索結(jié)果為空。后來把方案改成 Milvus 向量數(shù)據(jù)庫 RAG 檢索增強(qiáng)生成才真正把問題解決。這篇文章會(huì)圍繞 Milvus 2.6 和 RAG 展開從“向量數(shù)據(jù)庫到底是什么”講起再到 Docker Compose 部署 Milvus Standalone、Python 客戶端接入、文檔切塊、Embedding 寫入、相似度檢索、LLM 回答的完整鏈路。適合剛接觸 RAG 的開發(fā)者也適合準(zhǔn)備在企業(yè)項(xiàng)目里落地向量檢索的同學(xué)。讀完你不僅能搭出一套可演示的知識(shí)庫問答系統(tǒng)還能理解每一步背后的設(shè)計(jì)原因以及后續(xù)上生產(chǎn)時(shí)要注意的坑。1. 背景與核心概念1.1 什么是向量數(shù)據(jù)庫先做一個(gè)通俗類比。傳統(tǒng)關(guān)系型數(shù)據(jù)庫存的是行和列里面是字符串、數(shù)字、日期這類結(jié)構(gòu)化數(shù)據(jù)查詢方式以精確匹配和范圍過濾為主。向量數(shù)據(jù)庫則多了一種核心能力它可以存儲(chǔ)“向量”也就是一串浮點(diǎn)數(shù)例如[0.121, -0.051, 0.882, ...]并且能根據(jù)向量之間的“距離”快速找到最相近的向量。這串浮點(diǎn)數(shù)從哪里來它來自 Embedding 模型。我們可以把一段文字、一張圖片甚至一段音視頻都交給 Embedding 模型處理模型會(huì)輸出一個(gè)固定維度的向量。這個(gè)向量在向量空間中代表了原文的語義位置。語義相近的文本其向量距離更近語義無關(guān)的文本其向量距離更遠(yuǎn)。向量數(shù)據(jù)庫就是專門為這種“語義相似度檢索”設(shè)計(jì)的存儲(chǔ)和計(jì)算引擎。在企業(yè)場(chǎng)景中向量數(shù)據(jù)庫通常被用于推薦系統(tǒng)、相似圖片檢索、去重、多模態(tài)搜索以及目前最熱門的 RAG 知識(shí)庫問答。它解決的核心問題是在海量非結(jié)構(gòu)化數(shù)據(jù)中通過語義而不是關(guān)鍵詞完成近似度搜索。1.2 什么是 RAGRAG 的全稱是 Retrieval-Augmented Generation檢索增強(qiáng)生成。它的思路很簡(jiǎn)單大模型在回答用戶問題之前先從外部知識(shí)庫中檢索出相關(guān)資料把資料拼接到 Prompt 中再讓大模型依據(jù)這些資料生成答案。之所以需要 RAG是因?yàn)榇竽P痛嬖谌齻€(gè)天然問題。第一是知識(shí)時(shí)效性差模型訓(xùn)練完成之后訓(xùn)練數(shù)據(jù)以外的知識(shí)它并不知道第二是私有數(shù)據(jù)不可見企業(yè)內(nèi)部文檔、客服記錄、項(xiàng)目手冊(cè)不會(huì)出現(xiàn)在模型訓(xùn)練集中第三是幻覺問題面對(duì)不確定的內(nèi)容大模型可能會(huì)一本正經(jīng)地“編造”答案。RAG 通過實(shí)時(shí)檢索外部知識(shí)把回答限定在檢索到的資料范圍內(nèi)既能補(bǔ)充實(shí)時(shí)知識(shí)又能顯著降低幻覺概率。RAG 的典型流程可以分為離線索引和在線查詢兩個(gè)階段。離線階段把文檔切塊、向量化、寫入向量數(shù)據(jù)庫在線階段把用戶問題向量化在向量數(shù)據(jù)庫中檢索 TopK 相關(guān)片段組裝成 Prompt 后交給大模型生成回答。1.3 為什么選擇 Milvus 2.6市面上的向量數(shù)據(jù)庫并不少有開源的 Chroma、Qdrant、Weaviate也有 Elasticsearch 自帶的向量檢索能力。但從生產(chǎn)落地和項(xiàng)目規(guī)模來看Milvus 是國內(nèi)開發(fā)者和企業(yè)中使用非常廣泛的開源向量數(shù)據(jù)庫之一。Milvus 2.6 的定位是高可用、可擴(kuò)展的云原生向量數(shù)據(jù)庫。它的核心優(yōu)勢(shì)可以歸納為幾點(diǎn)。第一是索引類型豐富支持 FLAT、IVF、HNSW、DISKANN 等標(biāo)準(zhǔn)向量索引也支持稀疏向量和混合檢索第二是存儲(chǔ)與計(jì)算分離的架構(gòu)設(shè)計(jì)適合數(shù)據(jù)量從千萬級(jí)到億級(jí)以上的場(chǎng)景第三是 SDK 完善官方提供 Python、Java、Go、C# 等語言的客戶端第四是周邊生態(tài)成熟Dify、LangChain、LlamaIndex、Haystack 等框架內(nèi)都提供了 Milvus 的集成組件。Milvus 2.6 具體到版本層面在稀疏向量、多向量檢索、GPU 索引等能力上做了持續(xù)增強(qiáng)。如果你的項(xiàng)目還停留在概念驗(yàn)證階段用 Milvus 2.6 起步后續(xù)平滑升級(jí)到集群模式也相對(duì)容易。1.4 RAG 與向量數(shù)據(jù)庫的關(guān)系需要強(qiáng)調(diào)一點(diǎn)RAG 并不必然需要向量數(shù)據(jù)庫。你完全可以用 Elasticsearch 的 BM25 關(guān)鍵詞檢索來做召回也可以直接用關(guān)系型數(shù)據(jù)庫存向量然后暴力掃描或者用 Faiss 這類向量檢索庫。但實(shí)際工程中向量數(shù)據(jù)庫承擔(dān)的不只是“存向量”還包括索引加速、標(biāo)量過濾、數(shù)據(jù)生命周期管理、高可用和擴(kuò)展能力。在 RAG 鏈路中向量數(shù)據(jù)庫負(fù)責(zé)的是“召回”這一步。召回質(zhì)量直接決定最終回答質(zhì)量。如果向量數(shù)據(jù)庫檢索不到相關(guān)片段大模型再強(qiáng)也無濟(jì)于事。這也是為什么很多人說RAG 的上限由大模型決定下限卻由檢索質(zhì)量決定。2. 環(huán)境準(zhǔn)備與版本說明2.1 技術(shù)棧選型在動(dòng)手之前先確定整個(gè)示例的技術(shù)棧。本文以 Milvus 2.6 作為向量數(shù)據(jù)庫使用 Docker Compose 部署 Standalone 單機(jī)版本編程語言選擇 Python客戶端使用 pymilvusEmbedding 模型選擇開源的BAAI/bge-m3這個(gè)模型對(duì)中文語義理解效果較好輸出 1024 維向量LLM 部分為了不依賴特定云廠商示例使用 Ollama 啟動(dòng)本地模型如果企業(yè)項(xiàng)目中已經(jīng)使用 OpenAI、通義、DeepSeek 等服務(wù)的 OpenAI 兼容接口也可以直接替換。版本這里需要說明Milvus 處于快速迭代期本文使用的鏡像 tag 和 SDK 版本以你實(shí)際環(huán)境為準(zhǔn)。建議控制在 2.6.x 的同一大版本內(nèi)因?yàn)榇蟀姹旧?jí)往往涉及 API 變化和配置遷移。2.2 部署方式對(duì)比Milvus 的部署方式主要有四種適合不同階段。部署方式特點(diǎn)適用場(chǎng)景Milvus Lite進(jìn)程內(nèi)嵌隨 Python 環(huán)境啟動(dòng)無需 Docker本地學(xué)習(xí)、快速原型驗(yàn)證Standalone 單機(jī)一個(gè) Milvus 實(shí)例依賴 etcd 和 MinIO中小規(guī)模數(shù)據(jù)、項(xiàng)目測(cè)試、單機(jī)生產(chǎn)Cluster 集群分架構(gòu)部署支持分布式擴(kuò)容大規(guī)模數(shù)據(jù)、高并發(fā)生產(chǎn)環(huán)境云托管服務(wù)官方托管版免運(yùn)維預(yù)算充足、團(tuán)隊(duì)缺少運(yùn)維人力對(duì)于第一次接觸 Milvus 的同學(xué)推薦從 Standalone 開始既能完整體驗(yàn)真實(shí)服務(wù)的部署流程又不需要處理復(fù)雜的集群調(diào)度問題。2.3 Docker Compose 部署 Milvus Standalone演示環(huán)境以 Linux 或 macOS 為主Windows 也可以使用 Docker Desktop。先確保機(jī)器上已經(jīng)安裝 Docker 和 Docker Compose 插件。命令驗(yàn)證如下。docker --version docker compose version如果命令能正常輸出版本號(hào)說明環(huán)境就緒。然后創(chuàng)建一個(gè)項(xiàng)目目錄在目錄下新建docker-compose.yml。# docker-compose.yml version: 3.5 services: etcd: container_name: milvus-etcd image: quay.io/coreos/etcd:v3.5.18 environment: - ETCD_AUTO_COMPACTION_MODErevision - ETCD_AUTO_COMPACTION_RETENTION1000 - ETCD_QUOTA_BACKEND_BYTES4294967296 - ETCD_SNAPSHOT_COUNT50000 volumes: - ${DOCKER_VOLUME_DIRECTORY:-.}/volumes/etcd:/etcd command: etcd -advertise-client-urlshttp://127.0.0.1:2379 -listen-client-urls http://0.0.0.0:2379 --data-dir /etcd healthcheck: test: [CMD, etcdctl, endpoint, health] interval: 30s timeout: 20s retries: 3 minio: container_name: milvus-minio image: minio/minio:RELEASE.2023-03-20T20-16-18Z environment: MINIO_ACCESS_KEY: minioadmin MINIO_SECRET_KEY: minioadmin volumes: - ${DOCKER_VOLUME_DIRECTORY:-.}/volumes/minio:/minio_data command: minio server /minio_data --console-address :9001 healthcheck: test: [CMD, curl, -f, http://localhost:9000/minio/health/live] interval: 30s timeout: 20s retries: 3 standalone: container_name: milvus-standalone image: milvusdb/milvus:v2.6.1 command: [milvus, run, standalone] security_opt: - seccomp:unconfined environment: ETCD_ENDPOINTS: etcd:2379 MINIO_ADDRESS: minio:9000 volumes: - ${DOCKER_VOLUME_DIRECTORY:-.}/volumes/milvus:/var/lib/milvus healthcheck: test: [CMD, curl, -f, http://localhost:9091/healthz] interval: 30s start_period: 90s timeout: 20s retries: 3 ports: - 19530:19530 - 9091:9091 depends_on: - etcd - minio這個(gè) Compose 文件包含了三個(gè)服務(wù)etcd 負(fù)責(zé)存儲(chǔ) Milvus 的元數(shù)據(jù)MinIO 負(fù)責(zé)存儲(chǔ)日志和索引文件standalone 是 Milvus 主服務(wù)。19530是客戶端連接的 gRPC 端口9091是健康檢查和管理端口。啟動(dòng)命令如下。docker compose up -d首次啟動(dòng)需要拉取鏡像具體耗時(shí)取決于網(wǎng)絡(luò)和 Docker Hub 的訪問情況。啟動(dòng)后查看容器狀態(tài)。docker compose ps docker logs milvus-standalone -f當(dāng)看到 Milvus 相關(guān)服務(wù)啟動(dòng)完成的日志并且curl http://localhost:9091/healthz返回正常響應(yīng)說明部署成功。有一點(diǎn)要注意seccomp:unconfined這個(gè)配置在部分內(nèi)核版本上是必須的如果啟動(dòng)失敗提示權(quán)限問題可以優(yōu)先檢查這一項(xiàng)。2.4 安裝 Python 依賴Milvus 服務(wù)啟動(dòng)之后需要安裝 Python 客戶端。新建一個(gè) Python 虛擬環(huán)境然后安裝依賴。python3 -m venv venv source venv/bin/activate pip install pymilvus sentence-transformers requests在實(shí)際項(xiàng)目中建議把依賴寫入requirements.txt文件方便復(fù)現(xiàn)環(huán)境。pymilvus 與 Milvus 服務(wù)端有版本匹配關(guān)系建議安裝與服務(wù)端大版本一致的 SDK例如 Milvus 2.6 對(duì)應(yīng) pymilvus 2.6 系列。3. Milvus 核心原理與檢索機(jī)制3.1 核心概念Collection、Field、Schema在 Milvus 中Collection可以類比關(guān)系型數(shù)據(jù)庫中的表Field類比字段Entity類比一行數(shù)據(jù)。每個(gè) Collection 必須有一個(gè)主鍵字段此外可以包含標(biāo)量字段和向量字段。向量字段可以有一個(gè)或多個(gè)用來承載 Embedding 結(jié)果。創(chuàng)建 Collection 時(shí)需要定義 Schema。Schema 需要說明每個(gè)字段的名稱、數(shù)據(jù)類型、是否主鍵、向量維度等信息。例如一個(gè)典型的 RAG 知識(shí)庫集合包含四個(gè)字段id主鍵、content文本內(nèi)容、source文檔來源、embedding文本向量。需要區(qū)分的是Milvus 的 Schema 設(shè)計(jì)是“先定義后使用”的不像傳統(tǒng)數(shù)據(jù)庫可以隨意 ALTER TABLE。雖然 2.6 版本支持部分動(dòng)態(tài)字段但生產(chǎn)環(huán)境中仍然建議在創(chuàng)建集合前仔細(xì)設(shè)計(jì)字段避免后續(xù)頻繁變更 Schema。3.2 向量索引原理在解釋 Milvus 的檢索機(jī)制之前先看一個(gè)看似簡(jiǎn)單的問題如果數(shù)據(jù)量只有幾千條直接暴力計(jì)算所有向量與查詢向量的距離也就是 FLAT 索引完全沒有問題??僧?dāng)數(shù)據(jù)量漲到一億條每次查詢都做全量距離計(jì)算延遲和 CPU 開銷都會(huì)高到不可接受。因此 Milvus 支持多種 ANN 近似最近鄰索引。IVF系列索引先通過聚類把向量空間劃分為多個(gè)桶查詢時(shí)只搜索相近的若干個(gè)桶犧牲少量精度換速度HNSW則基于多層跳表結(jié)構(gòu)構(gòu)建一張可導(dǎo)航的小世界圖查詢時(shí)從高層入口逐層逼近目標(biāo)節(jié)點(diǎn)召回率高延遲也比較穩(wěn)定是當(dāng)前最常用的索引類型之一DISKANN適合超大數(shù)據(jù)量可以把索引放到磁盤上減少內(nèi)存占用。HNSW 有四個(gè)關(guān)鍵參數(shù)值得關(guān)注。M控制每個(gè)節(jié)點(diǎn)的最大連接數(shù)值越大圖越稠密召回率越高但內(nèi)存和構(gòu)建時(shí)間也會(huì)增加efConstruction控制建圖時(shí)的動(dòng)態(tài)候選列表大小影響索引構(gòu)建質(zhì)量ef是查詢時(shí)的候選列表大小值越大檢索越精確但耗時(shí)越高metric_type指定距離計(jì)算方式。一般來說M取 16 到 32efConstruction取 200 左右ef取 64 到 128是比較穩(wěn)妥的起步配置。3.3 距離度量類型Milvus 常用的距離度量有三種。L2歐氏距離計(jì)算的是兩個(gè)向量之間的直線距離值越小越相似IP內(nèi)積通常用于歸一化向量值越大越相似COSINE余弦相似度計(jì)算的是向量夾角的余弦值值越大越相似關(guān)注“方向”而不是“長(zhǎng)度”。對(duì)于文本 Embedding推薦使用COSINE。因?yàn)楹芏?Embedding 模型輸出的向量雖然沒有強(qiáng)制歸一化但語義相似度更適合用余弦來衡量。在使用 COSINE 時(shí)Milvus 內(nèi)部通常會(huì)對(duì)向量做歸一化處理查詢效果更穩(wěn)定。如果使用 OpenAI 的text-embedding-ada-002官方也建議使用余弦相似度。3.4 標(biāo)量過濾與混合檢索真實(shí)業(yè)務(wù)中單純的向量檢索往往不夠。例如知識(shí)庫中既包含技術(shù)文檔也包含財(cái)務(wù)制度用戶可能只想在“財(cái)務(wù)”分類下檢索。這時(shí)就需要在向量檢索之前或同時(shí)增加標(biāo)量過濾條件。Milvus 支持在 search 請(qǐng)求中攜帶filter表達(dá)式例如source finance實(shí)現(xiàn)向量相似度檢索和標(biāo)量條件過濾的一體化查詢。這種能力對(duì) RAG 系統(tǒng)很重要它允許我們按權(quán)限、按文檔分類、按時(shí)間范圍縮小召回范圍避免向大模型喂入大量無關(guān)內(nèi)容。4. RAG 知識(shí)庫完整實(shí)戰(zhàn)4.1 整體流程設(shè)計(jì)為了讓思路更清晰先把整個(gè) RAG 系統(tǒng)的數(shù)據(jù)流拆開。文檔加載 - 文本切塊 - Embedding 向量化 - 寫入 Milvus Collection ↓ 用戶提問 - 問題 Embedding - Milvus 相似度檢索 - 召回 TopK 片段 ↓ 組裝 Prompt ↓ 大模型生成回答并返回前半部分是離線索引流程后半部分是在線查詢流程。兩個(gè)流程共享同一個(gè) Embedding 模型因此模型必須保持一致否則向量空間不同檢索結(jié)果沒有意義。4.2 項(xiàng)目結(jié)構(gòu)規(guī)劃本文用一個(gè)最小可運(yùn)行的項(xiàng)目來演示目錄結(jié)構(gòu)如下。rag-milvus/ ├── docker-compose.yml ├── config.py ├── build_kb.py └── query_kb.pyconfig.py統(tǒng)一管理 Milvus 連接參數(shù)、集合名、Embedding 模型、分塊參數(shù)等build_kb.py負(fù)責(zé)文檔切塊、向量化并寫入 Milvusquery_kb.py負(fù)責(zé)接收問題、檢索、組裝 Prompt 并調(diào)用大模型生成回答。4.3 編寫公共配置先創(chuàng)建config.py把整個(gè)鏈路中的關(guān)鍵參數(shù)集中到一個(gè)地方。# config.py MILVUS_HOST 127.0.0.1 MILVUS_PORT 19530 COLLECTION_NAME knowledge_base # Embedding 模型配置 EMBEDDING_MODEL BAAI/bge-m3 EMBEDDING_DIM 1024 # 文檔切塊參數(shù) CHUNK_SIZE 300 CHUNK_OVERLAP 50 # 檢索參數(shù) TOP_K 5 # LLM 服務(wù)配置 LLM_BASE_URL http://localhost:11434 LLM_MODEL qwen2.5:7b這里的EMBEDDING_DIM必須和所選 Embedding 模型的輸出維度一致。如果使用其他模型請(qǐng)先確認(rèn)模型輸出維度例如BAAI/bge-base-zh-v1.5是 768 維text-embedding-ada-002是 1536 維。維度和 Collection 定義不匹配會(huì)在插入數(shù)據(jù)時(shí)報(bào)錯(cuò)。4.4 文檔切塊與向量化寫入接下來編寫build_kb.py。這一步做的事情包括連接 Milvus、創(chuàng)建 Collection、加載本地文檔、切塊、生成向量、插入數(shù)據(jù)。# build_kb.py from pymilvus import ( connections, utility, CollectionSchema, FieldSchema, DataType, Collection ) from sentence_transformers import SentenceTransformer from config import ( MILVUS_HOST, MILVUS_PORT, COLLECTION_NAME, EMBEDDING_MODEL, EMBEDDING_DIM, CHUNK_SIZE, CHUNK_OVERLAP ) # 1. 連接 Milvus connections.connect(hostMILVUS_HOST, portMILVUS_PORT) # 2. 文本切塊 def chunks_from_text(text, sizeCHUNK_SIZE, overlapCHUNK_OVERLAP): chunks [] step size - overlap start 0 while start len(text): piece text[start: start size] if piece: chunks.append(piece) start step if len(piece) size: break return chunks # 3. 創(chuàng)建 Collection def create_collection(): if utility.has_collection(COLLECTION_NAME): existing Collection(COLLECTION_NAME) print(f集合 {COLLECTION_NAME} 已存在) return existing fields [ FieldSchema(nameid, dtypeDataType.INT64, is_primaryTrue, auto_idTrue), FieldSchema(namecontent, dtypeDataType.VARCHAR, max_length2048), FieldSchema(namesource, dtypeDataType.VARCHAR, max_length512), FieldSchema(nameembedding, dtypeDataType.FLOAT_VECTOR, dimEMBEDDING_DIM), ] schema CollectionSchema(fields, descriptionRAG knowledge base with Milvus 2.6) collection Collection(nameCOLLECTION_NAME, schemaschema) index_params { metric_type: COSINE, index_type: HNSW, params: {M: 16, efConstruction: 200} } collection.create_index(field_nameembedding, index_paramsindex_params) print(f集合 {COLLECTION_NAME} 創(chuàng)建完成) return collection # 4. 入口函數(shù) def build(): model SentenceTransformer(EMBEDDING_MODEL) collection create_collection() # 實(shí)際項(xiàng)目中將這個(gè)列表替換為文檔讀取邏輯 documents [ { source: internal_manual.txt, text: 差旅費(fèi)用報(bào)銷流程如下第一步提交申請(qǐng)第二步填寫明細(xì) 第三步等待審批財(cái)務(wù)在五個(gè)工作日內(nèi)完成打款。如果需要加急 請(qǐng)?zhí)崆奥?lián)系財(cái)務(wù)部門并說明原因。 }, { source: faq.txt, text: 發(fā)票丟失時(shí)可以在系統(tǒng)中申請(qǐng)電子發(fā)票復(fù)印件經(jīng)項(xiàng)目經(jīng)理確認(rèn)后 財(cái)務(wù)按原件流程處理。補(bǔ)交申請(qǐng)需要在報(bào)銷截止日前完成。 } ] rows [] for doc in documents: chunks chunks_from_text(doc[text]) if not chunks: continue vectors model.encode(chunks).tolist() for chunk, vec in zip(chunks, vectors): rows.append({ content: chunk, source: doc[source], embedding: vec }) collection.insert(rows) collection.flush() collection.load() print(f已寫入 {len(rows)} 個(gè)向量片段) if __name__ __main__: build()這段代碼有幾個(gè)細(xì)節(jié)值得說明。chunks_from_text函數(shù)采用固定字符長(zhǎng)度切塊并允許相鄰片段之間存在重疊目的是減少句子被從中間截?cái)鄮淼恼Z義損失。create_collection中通過utility.has_collection判斷集合是否已存在避免重復(fù)創(chuàng)建報(bào)錯(cuò)。embedding字段的維度必須與模型輸出維度一致。最后插入數(shù)據(jù)后調(diào)用flush強(qiáng)制落盤load將數(shù)據(jù)加載到內(nèi)存這樣后續(xù)查詢才能命中索引。執(zhí)行導(dǎo)庫腳本。python build_kb.py如果一切正常會(huì)輸出類似下面的結(jié)果。集合 knowledge_base 創(chuàng)建完成 已寫入 2 個(gè)向量片段由于示例文檔較短寫入片段較少。真實(shí)項(xiàng)目中文檔數(shù)量可能是幾千甚至上百萬這時(shí)需要批量插入并考慮分批提交。4.5 檢索與問答再創(chuàng)建query_kb.py實(shí)現(xiàn)用戶問題檢索和回答生成。# query_kb.py from pymilvus import connections, Collection from sentence_transformers import SentenceTransformer import requests from config import ( MILVUS_HOST, MILVUS_PORT, COLLECTION_NAME, EMBEDDING_MODEL, TOP_K, LLM_BASE_URL, LLM_MODEL ) connections.connect(hostMILVUS_HOST, portMILVUS_PORT) model SentenceTransformer(EMBEDDING_MODEL) def call_llm(messages): # 以 Ollama 為例OpenAI 兼容服務(wù)可以替換為對(duì)應(yīng)地址 resp requests.post( f{LLM_BASE_URL}/api/chat, json{ model: LLM_MODEL, messages: messages, stream: False }, timeout60 ) resp.raise_for_status() return resp.json()[message][content] def search(query): query_vec model.encode([query]).tolist() collection Collection(COLLECTION_NAME) collection.load() results collection.search( dataquery_vec, anns_fieldembedding, param{metric_type: COSINE, params: {ef: 64}}, limitTOP_K, output_fields[content, source] ) docs [] for hit in results[0]: content hit.entity.get(content) source hit.entity.get(source) docs.append(f[來源:{source}] {content}相似度:{hit.distance:.4f}) return docs def ask(question): docs search(question) context \n.join(docs) messages [ { role: system, content: 你是一個(gè)知識(shí)庫助理請(qǐng)嚴(yán)格基于提供的參考資料回答問題 如果資料中沒有相關(guān)內(nèi)容請(qǐng)明確說明不知道不要編造。 }, { role: user, content: f參考資料\n{context}\n\n問題{question} } ] answer call_llm(messages) return answer, docs if __name__ __main__: q 發(fā)票丟失了還能報(bào)銷嗎 answer, refs ask(q) print(檢索到的參考資料) for r in refs: print(r) print(\n回答) print(answer)search函數(shù)將用戶問題向量化然后在 Milvus 中執(zhí)行相似度檢索返回前TOP_K個(gè)片段。ask函數(shù)把檢索結(jié)果組裝進(jìn) Prompt再調(diào)用大模型。這里使用的 Prompt 模板是 RAG 中最基礎(chǔ)的形態(tài)明確要求模型只依據(jù)參考資料回答。在運(yùn)行前需要確保 Ollama 服務(wù)已啟動(dòng)并且已經(jīng)拉取了配置文件中指定的模型。ollama pull qwen2.5:7b ollama serve然后運(yùn)行問答腳本。python query_kb.py預(yù)期輸出大致如下。大模型的具體表述每次可能不同但關(guān)鍵信息應(yīng)該來自檢索到的資料。檢索到的參考資料 [來源:faq.txt] 發(fā)票丟失時(shí)可以在系統(tǒng)中申請(qǐng)電子發(fā)票復(fù)印件經(jīng)項(xiàng)目經(jīng)理確認(rèn)后財(cái)務(wù)按原件流程處理。補(bǔ)交申請(qǐng)需要在報(bào)銷截止日前完成。相似度:0.xxxx 回答 可以報(bào)銷。發(fā)票丟失后您可以在系統(tǒng)中申請(qǐng)電子發(fā)票復(fù)印件經(jīng)過項(xiàng)目經(jīng)理確認(rèn)后財(cái)務(wù)會(huì)按原件流程處理但需要注意補(bǔ)交申請(qǐng)應(yīng)在報(bào)銷截止日前完成。到這里一個(gè)最小可用的 RAG 知識(shí)庫問答系統(tǒng)已經(jīng)跑通了。接下來我們看看這個(gè)鏈路中經(jīng)常出現(xiàn)的問題以及對(duì)應(yīng)的排查方法。5. 常見問題與排查思路問題現(xiàn)象常見原因解決思路docker compose up -d啟動(dòng)后服務(wù)不斷重啟鏡像 tag 不存在或 Docker 配置不支持查看docker logs確認(rèn)鏡像版本和security_opt配置Python 連接 Milvus 提示 19530 端口拒絕連接Milvus Standalone 未啟動(dòng)或端口映射錯(cuò)誤使用docker compose ps查看容器狀態(tài)確認(rèn)防火墻放行端口插入數(shù)據(jù)時(shí)報(bào)維度錯(cuò)誤Collection 的向量維度與 Embedding 模型輸出維度不一致查詢模型輸出維度重新創(chuàng)建 Collection或者更換模型檢索結(jié)果為空數(shù)據(jù)未 load或查詢向量與集合向量不在同一語義空間調(diào)用collection.load()并確認(rèn)使用同一個(gè) Embedding 模型大模型回答與檢索資料無關(guān)Prompt 中檢索上下文拼接錯(cuò)誤檢查output_fields是否提取到content并觀察檢索到的文本內(nèi)容Ollama 請(qǐng)求超時(shí)模型未啟動(dòng)或機(jī)器性能不足先運(yùn)行ollama list確認(rèn)模型換更小的模型測(cè)試查詢延遲越來越高未建索引或索引類型不合適數(shù)據(jù)量增大檢查describe_index必要時(shí)重建 HNSW 索引這里重點(diǎn)說一下“檢索結(jié)果為空”的排查。遇到這類問題不要急著調(diào)大模型 Prompt先單獨(dú)跑一遍search函數(shù)打印檢索到的片段。如果 Milvus 返回結(jié)果為空最常見的原因有兩個(gè)一是集合創(chuàng)建后插入數(shù)據(jù)但沒有調(diào)用load二是查詢時(shí)用了不同的 Embedding 模型導(dǎo)致查詢向量和庫里向量完全不在一個(gè)語義空間。另一個(gè)高頻問題是 Docker 啟動(dòng)失敗。很多初學(xué)者看到milvus-standalone容器反復(fù)重啟就束手無策。排查順序應(yīng)該是先用docker logs milvus-standalone查看主服務(wù)日志再檢查 etcd 和 MinIO 的健康狀態(tài)最后確認(rèn)宿主機(jī)端口是否被占用。Milvus 依賴 etcd 的元數(shù)據(jù)和 MinIO 的存儲(chǔ)如果這兩個(gè)組件不健康主服務(wù)必然無法正常工作。6. RAG 與 Milvus 工程化最佳實(shí)踐6.1 文檔切塊策略切塊是 RAG 系統(tǒng)中影響檢索質(zhì)量最重要的因素之一但它又容易被忽略。切塊太小單個(gè)片段信息量不足容易召回語義不完整的碎片切塊太大片段中混入大量無關(guān)內(nèi)容向量被平均后可能偏離核心主題而且大塊文本會(huì)占用更多 Prompt token。一個(gè)比較實(shí)用的策略是“結(jié)構(gòu)化小塊 重疊窗口”。如果文檔有清晰的標(biāo)題和段落結(jié)構(gòu)可以盡量按標(biāo)題層級(jí)切塊保證每個(gè) chunk 在語義上自洽。如果沒有結(jié)構(gòu)可以使用固定字符切塊并讓相鄰 chunk 重疊 10% 到 20%。例如CHUNK_SIZE300CHUNK_OVERLAP50這樣句子不容易被硬生生截?cái)?。更?fù)雜的項(xiàng)目還可以考慮先切句子再把相鄰句子按 token 上限合并或者引入語義切塊模型。切塊上線后務(wù)必人工抽檢幾個(gè)典型問題的召回結(jié)果根據(jù)實(shí)際效果調(diào)整參數(shù)。6.2 Embedding 模型選擇與向量維度中文場(chǎng)景下目前開源社區(qū)使用較多的有 BGE 系列、M3E 系列以及近年出現(xiàn)的BAAI/bge-m3。這類模型對(duì)中文語義理解比較友好模型體積也能接受。如果業(yè)務(wù)數(shù)據(jù)以英文為主OpenAI 的 embedding 系列或 SentenceTransformers 下的英文模型都是可選方案。選擇 Embedding 模型時(shí)不能只看效果還要關(guān)注向量維度。維度越高單個(gè)向量占用的存儲(chǔ)越大檢索計(jì)算量也越大。比如