戰(zhàn):Neo4j+Python構(gòu)建實(shí)體抽取與問答系統(tǒng)全攻略)
做知識圖譜最怕的不是不會寫代碼而是面對一堆概念不知道先干哪個(gè)。這次我們直接圍繞一套完整鏈路來聊Neo4j 圖數(shù)據(jù)庫 Python 數(shù)據(jù)處理 實(shí)體抽取 知識圖譜可視化 問答系統(tǒng)。從零開始不跳步最終能跑出一個(gè)可以查詢、可以回答問題的圖數(shù)據(jù)庫應(yīng)用。先說這個(gè)體系里最值得關(guān)注的點(diǎn)Neo4j 是目前應(yīng)用最廣的圖數(shù)據(jù)庫適合存實(shí)體和關(guān)系的網(wǎng)絡(luò)型數(shù)據(jù)Python 負(fù)責(zé)把 Excel、CSV、爬蟲拿到的非結(jié)構(gòu)化數(shù)據(jù)清洗成實(shí)體關(guān)系三元組實(shí)體抽取做的是從文本里找出人名、組織、地點(diǎn)和關(guān)系問答系統(tǒng)則把用戶的自然語言問題轉(zhuǎn)成圖譜查詢返回答案。本文會帶你完成這些實(shí)操內(nèi)容安裝配置 Neo4j理解 Node、Relationship、Property、Label。用 Python 處理一份樣例數(shù)據(jù)構(gòu)造成三元組。通過 py2neo 或 neo4j Driver 寫入 Neo4j。用 Cypher 查詢驗(yàn)證圖譜。實(shí)體抽取與關(guān)系抽取的入門實(shí)現(xiàn)。構(gòu)建一個(gè)最小可用的知識圖譜問答系統(tǒng)。常見報(bào)錯(cuò)和性能排查。適合以下讀者想做知識圖譜實(shí)戰(zhàn)的算法工程師、后端開發(fā)、數(shù)據(jù)分析師、準(zhǔn)備知識圖譜相關(guān)畢設(shè)或面試項(xiàng)目的學(xué)生以及想把結(jié)構(gòu)化數(shù)據(jù)轉(zhuǎn)成圖譜做問答演示的技術(shù)愛好者。不需要你有圖數(shù)據(jù)庫基礎(chǔ)但最好會一點(diǎn) Python。1. 核心能力速覽能力項(xiàng)說明核心組件Neo4j Community Edition、Python 3、py2neo 或 neo4j 官方驅(qū)動圖數(shù)據(jù)庫Neo4j使用 Cypher 查詢語言Python 庫pandas、py2neo、neo4j、jieba、spaCy、hanlp按需選擇主要功能實(shí)體抽取、關(guān)系抽取、知識圖譜構(gòu)建、可視化、問答系統(tǒng)技術(shù)路線文本/表格數(shù)據(jù) - 三元組 - Neo4j - Cypher 查詢 - Flask/FastAPI 問答接口部署方式本地 Windows / Linux / Mac 桌面版或 Docker是否支持 API支持Neo4j 提供 HTTP 和 Bolt 接口Python Driver 可直接連接是否支持批量任務(wù)支持可用 Python 批量寫入節(jié)點(diǎn)和關(guān)系適合場景智能客服問答、企業(yè)知識管理、風(fēng)控關(guān)聯(lián)分析、學(xué)術(shù)研究、畢設(shè)項(xiàng)目硬件門檻普通 8G 內(nèi)存電腦可運(yùn)行Neo4j 建議 4G 以上內(nèi)存顯存需求無需 GPU從表中可以快速判斷這套方案不依賴顯卡普通開發(fā)機(jī)能跑重點(diǎn)成本在數(shù)據(jù)清洗和實(shí)體關(guān)系建模上。2. 適用場景與使用邊界先明確這套技術(shù)棧能做什么、不能做什么避免學(xué)完發(fā)現(xiàn)方向不對。知識圖譜 Neo4j Python 這套組合適合以下場景企業(yè)數(shù)據(jù)治理把散落在多個(gè) Excel、數(shù)據(jù)庫、API 里的實(shí)體和關(guān)系統(tǒng)一建模形成一個(gè)可查詢的關(guān)聯(lián)網(wǎng)絡(luò)。智能客服與問答系統(tǒng)通過實(shí)體抽取和關(guān)系查詢回答“某公司持股了哪些公司”“某導(dǎo)演拍過哪些電影”這類事實(shí)型問題。風(fēng)控與反欺詐分析股權(quán)穿透、交易對手、擔(dān)保關(guān)系識別關(guān)聯(lián)風(fēng)險(xiǎn)。醫(yī)療與科研挖掘疾病、藥物、靶點(diǎn)、文獻(xiàn)之間的關(guān)聯(lián)。圖譜可視化與匯報(bào)Neo4j Browser 自帶可視化能直接給業(yè)務(wù)方展示關(guān)聯(lián)關(guān)系。大模型知識增強(qiáng)把圖查詢結(jié)果作為大模型的外部知識來源減少幻覺這在 RAG檢索增強(qiáng)生成里很常見。不適合的場景也要說清楚不適合高并發(fā)在線 OLTP 業(yè)務(wù)Neo4j 是圖數(shù)據(jù)庫不是萬能存儲。不適合低代碼可視化報(bào)表類需求Neo4j Browser 的可視化偏開發(fā)向復(fù)雜圖表需要接 ECharts、D3 或 Gephi。不適合沒有數(shù)據(jù)源、只想“先搭個(gè)圖譜玩玩”的情況知識圖譜的核心是數(shù)據(jù)沒有數(shù)據(jù)和實(shí)體關(guān)系圖譜就是空殼。使用邊界和合規(guī)要求數(shù)據(jù)來源必須合法不要爬取或使用未授權(quán)的個(gè)人隱私數(shù)據(jù)、通訊錄、證件信息等數(shù)據(jù)來構(gòu)建圖譜。涉及企業(yè)股權(quán)、交易對手等場景必須確認(rèn)數(shù)據(jù)獲取和展示符合相關(guān)合規(guī)要求。如果后續(xù)把圖譜能力接入面向外部用戶的問答系統(tǒng)需要對答案做審核和可用性校驗(yàn)避免因關(guān)系缺失或數(shù)據(jù)錯(cuò)誤誤導(dǎo)用戶。技術(shù)文檔中涉及到的數(shù)據(jù)和示例建議使用脫敏的虛擬數(shù)據(jù)不要直接使用真實(shí)業(yè)務(wù)數(shù)據(jù)做公開演示。3. 環(huán)境準(zhǔn)備與前置條件3.1 操作系統(tǒng)與軟件版本Neo4j 支持 Windows、Linux、macOS。這里以本地開發(fā)最常見的方式為例Windows 或 Linux 上安裝 Neo4j Desktop 或 Neo4j Community Server然后用 Python 連接。建議環(huán)境如下操作系統(tǒng)Windows 10/11 或 Ubuntu 20.04/22.04Python3.8 及以上Neo4jCommunity 4.4 或 5.x 均可JDK如果使用 Neo4j 5.x一般需要 JDK 17不同版本要求不同推薦以官方文檔為準(zhǔn)安裝 Neo4j 之前先確認(rèn) Java 環(huán)境。Neo4j 4.4 默認(rèn)使用 Java 11Neo4j 5.x 推薦 Java 17。如果本機(jī)已有多個(gè) Java 版本建議用 JAVA_HOME 環(huán)境變量明確指定版本。3.2 Neo4j 安裝方式Neo4j 的安裝方式主要有三種Neo4j Desktop圖形化安裝適合新手??梢栽谧烂娑藙?chuàng)建數(shù)據(jù)庫、管理啟動關(guān)閉、打開 Browser。Neo4j Community Server直接解壓使用適合服務(wù)器部署或自動化腳本。Docker適合習(xí)慣容器化部署的同學(xué)docker run一行啟動。下面是 Docker 啟動 Neo4j 的常見寫法適用于快速測試docker run -d \ --name neo4j-test \ -p 7474:7474 -p 7687:7687 \ -e NEO4J_AUTHneo4j/testpassword \ neo4j:5.19.0啟動后瀏覽器訪問http://localhost:7474用neo4j / testpassword登錄首次連接后會要求修改密碼。如果用 Neo4j Desktop流程更簡單安裝桌面版新建 Project添加 Local DBMS設(shè)置密碼然后啟動數(shù)據(jù)庫點(diǎn)擊 Open Browser 即可。3.3 端口說明Neo4j 有兩個(gè)端口比較關(guān)鍵7474HTTP 端口Neo4j Browser 和 REST API 使用。7687Bolt 端口Python Driver 等客戶端連接使用。如果本機(jī)端口被占用可以在neo4j.conf中修改dbms.connector.http.port和dbms.connector.bolt.port。3.4 Python 依賴推薦使用 venv 或 conda 創(chuàng)建虛擬環(huán)境避免依賴沖突。python -m venv kg_env source kg_env/bin/activate # Windows 下使用 kg_env\Scripts\activate安裝需要的依賴pip install pandas neo4j py2neo flask說明一下neo4j是官方 Python Driver適合直接執(zhí)行 Cypher。py2neo是社區(qū)封裝庫寫節(jié)點(diǎn)和關(guān)系更簡潔適合圖譜寫入和簡單查詢。pandas用來讀取和處理數(shù)據(jù)。flask或fastapi用來構(gòu)建問答接口服務(wù)。如果需要做中文實(shí)體抽取可以再安裝pip install jieba如果使用 spaCypip install spacy python -m spacy download zh_core_web_sm # 中文模型按需下載4. 安裝部署與啟動方式4.1 Linux 服務(wù)器安裝 Neo4j Community Server這里以 Linux 安裝 Neo4j Community Server 為例。不同版本安裝命令不同下面是較為通用的下載解壓方式wget https://dist.neo4j.org/neo4j-community-5.19.0-unix.tar.gz tar -xzf neo4j-community-5.19.0-unix.tar.gz cd neo4j-community-5.19.0啟動服務(wù)bin/neo4j start查看狀態(tài)bin/neo4j status停止服務(wù)bin/neo4j stop如果是 Windows下載 zip 包后解壓在命令提示符中執(zhí)行bin\neo4j consoleconsole模式會前臺運(yùn)行日志直接輸出到控制臺適合調(diào)試。生產(chǎn)環(huán)境建議用bin\neo4j install-service注冊成服務(wù)。4.2 Neo4j Desktop 啟動Neo4j Desktop 啟動數(shù)據(jù)庫后Browser 地址通常是http://localhost:7474/browser/。首次進(jìn)入會提示修改密碼修改后保持記住方便 Python 連接。4.3 Docker 啟動如果本機(jī)沒有安裝 Neo4j用 Docker 是最省事的方式前面已經(jīng)給出啟動命令。需要說明的是Docker 方式默認(rèn)配置較少如果要做中文全文索引或?qū)氪罅繑?shù)據(jù)建議掛載數(shù)據(jù)卷和配置文件。docker run -d \ --name neo4j-kg \ -p 7474:7474 -p 7687:7687 \ -v /home/user/neo4j/data:/data \ -v /home/user/neo4j/logs:/logs \ -e NEO4J_AUTHneo4j/kgtest2025 \ neo4j:5.19.0啟動后等待幾秒等 Neo4j 完成初始化再訪問 Browser。5. 數(shù)據(jù)準(zhǔn)備與知識圖譜建模在寫代碼之前先明確一個(gè)核心概念知識圖譜的基本單位是三元組(實(shí)體1, 關(guān)系, 實(shí)體2)。例如(張三, 持股, 某某科技公司)這里“張三”和“某某科技公司”是節(jié)點(diǎn)“持股”是關(guān)系?,F(xiàn)實(shí)數(shù)據(jù)往往不是干凈的三元組。以 Excel 表格為例可能長這樣姓名公司職位學(xué)歷城市張三云圖科技CTO清華大學(xué)北京李四智譜數(shù)據(jù)CEO北京大學(xué)上海王五云圖科技算法工程師復(fù)旦大學(xué)北京這些數(shù)據(jù)可以建模成人節(jié)點(diǎn)張三、李四、王五屬性有姓名、學(xué)歷、城市。公司節(jié)點(diǎn)云圖科技、智譜數(shù)據(jù)屬性有公司名。關(guān)系張三 - 就職于 - 云圖科技張三 - 擔(dān)任 - CTO。建模方法是先想清楚業(yè)務(wù)問題。比如你做智能客服問答最關(guān)心的是人員、公司、職位、城市之間的關(guān)系做股權(quán)穿透則關(guān)心公司、股東、持股比例、投資時(shí)間等。這里不需要一次性設(shè)計(jì)太復(fù)雜的模型先設(shè)計(jì) 2 到 3 種節(jié)點(diǎn)和 2 到 3 種關(guān)系跑通流程后再擴(kuò)展。下面用 Python 封裝一個(gè)最簡單的三元組樣例數(shù)據(jù)方便后續(xù)寫入import pandas as pd data [ (張三, 就職于, 云圖科技), (李四, 就職于, 智譜數(shù)據(jù)), (王五, 就職于, 云圖科技), (張三, 擔(dān)任, CTO), (李四, 擔(dān)任, CEO), (王五, 擔(dān)任, 算法工程師), ] df pd.DataFrame(data, columns[head, relation, tail]) print(df.head())head relation tail 0 張三 就職于 云圖科技 1 李四 就職于 智譜數(shù)據(jù) 2 王五 就職于 云圖科技 3 張三 擔(dān)任 CTO 4 李四 擔(dān)任 CEO 5 王五 擔(dān)任 算法工程師從這里開始數(shù)據(jù)和代碼就接上了。6. 使用 Python 寫入 Neo4j6.1 連接 Neo4j先測試 Neo4j 連接。這里用官方 neo4j Driver 連接 Bolt 端口from neo4j import GraphDatabase uri bolt://localhost:7687 username neo4j password your_password driver GraphDatabase.driver(uri, auth(username, password)) def test_connection(): with driver.session() as session: result session.run(RETURN connection ok AS message) for record in result: print(record[message]) test_connection() driver.close()如果輸出connection ok說明連接成功。常見問題拋出 AuthenticationError說明用戶名或密碼不對拋 ConnectionRefused說明 Neo4j 沒啟動或端口不對。6.2 創(chuàng)建節(jié)點(diǎn)和關(guān)系用官方 Driver 寫 Cypher 創(chuàng)建節(jié)點(diǎn)def create_graph(driver): with driver.session() as session: session.run( MERGE (p:Person {name: $name}) MERGE (c:Company {name: $company}) MERGE (p)-[:WORKS_AT]-(c), name張三, company云圖科技 ) create_graph(driver)注意這里用了 MERGE 而不是 CREATE因?yàn)?MERGE 會先查找是否存在相同節(jié)點(diǎn)避免重復(fù)創(chuàng)建。但這樣寫每對數(shù)據(jù)都要寫一次批量寫入時(shí)我們需要封裝循環(huán)。下面是批量寫入的完整腳本from neo4j import GraphDatabase class Neo4jWriter: def __init__(self, uri, user, password): self.driver GraphDatabase.driver(uri, auth(user, password)) def close(self): self.driver.close() def add_person_company(self, person_name, company_name, positionNone): with self.driver.session() as session: session.run( MERGE (p:Person {name: $person_name}) MERGE (c:Company {name: $company_name}) MERGE (p)-[:WORKS_AT]-(c) , person_nameperson_name, company_namecompany_name ) if position: session.run( MATCH (p:Person {name: $person_name}) SET p.position $position , person_nameperson_name, positionposition ) def add_relations_from_list(self, triple_list): with self.driver.session() as session: for head, relation, tail in triple_list: session.run( f MATCH (a), (b) WHERE a.name $head AND b.name $tail MERGE (a)-[r:{relation}]-(b) , headhead, tailtail )這里有一個(gè)要注意的問題relation作為關(guān)系類型時(shí)Cypher 不支持參數(shù)化關(guān)系類型。所以上面代碼用了 f-string 拼接關(guān)系類型。雖然數(shù)據(jù)來自我們自己的三元組列表風(fēng)險(xiǎn)可控但如果關(guān)系類型來自外部不可信輸入務(wù)必做白名單校驗(yàn)否則可能產(chǎn)生注入風(fēng)險(xiǎn)。更安全的做法是預(yù)先定義關(guān)系類型枚舉只允許固定值傳入。比如ALLOWED_RELATIONS {就職于, 擔(dān)任, 持股, 投資, 位于} def safe_add_relation(session, head, relation, tail): if relation not in ALLOWED_RELATIONS: raise ValueError(f非法關(guān)系類型: {relation}) session.run( f MATCH (a), (b) WHERE a.name $head AND b.name $tail MERGE (a)-[r:{relation}]-(b) , headhead, tailtail )如果你更希望使用 py2neo可以這樣寫from py2neo import Graph, Node, Relationship graph Graph(bolt://localhost:7687, auth(neo4j, your_password)) a Node(Person, name張三, city北京) b Node(Company, name云圖科技) ab Relationship(a, 就職于, b) graph.create(ab)py2neo 的優(yōu)點(diǎn)是節(jié)點(diǎn)和關(guān)系的 Python 對象化更直觀適合數(shù)據(jù)量較小、需要快速寫原型的場景官方 Driver 性能更好、更可控適合批量數(shù)據(jù)處理。建議剛開始用官方 Driver代碼更接近 Cypher 本身。6.3 批量導(dǎo)入大量數(shù)據(jù)如果數(shù)據(jù)量較大用逐條 MERGE 會慢。這時(shí)可以先把數(shù)據(jù)整理成 CSV然后用 Neo4j 的LOAD CSV指令導(dǎo)入效率遠(yuǎn)高于 Python 逐條寫入。CSV 文件people_companies.csvperson,company,position 張三,云圖科技,CTO 李四,智譜數(shù)據(jù),CEO 王五,云圖科技,算法工程師把 CSV 放到 Neo4j 的import目錄下然后在 Browser 中執(zhí)行LOAD CSV WITH HEADERS FROM file:///people_companies.csv AS row MERGE (p:Person {name: row.person}) MERGE (c:Company {name: row.company}) MERGE (p)-[:WORKS_AT]-(c) SET p.position row.position;執(zhí)行結(jié)果會顯示創(chuàng)建的節(jié)點(diǎn)數(shù)。這種方式適合萬級以上數(shù)據(jù)。需要注意 CSV 文件編碼中文建議使用 UTF-8否則會出現(xiàn)亂碼。7. 實(shí)體抽取與關(guān)系抽取如果只有結(jié)構(gòu)化表格上一節(jié)已經(jīng)夠用了。但真實(shí)項(xiàng)目中更多數(shù)據(jù)是純文本比如新聞、公告、客服對話。這時(shí)候需要實(shí)體抽取和關(guān)系抽取。7.1 基于規(guī)則的實(shí)體抽取最簡單的入門方式是使用 jieba 分詞 自定義詞典。先構(gòu)造一個(gè)小規(guī)模實(shí)體詞表import jieba entity_dict [云圖科技, 智譜數(shù)據(jù), 張三, 李四, 王五, CEO, CTO, 清華, 北京] for word in entity_dict: jieba.add_word(word) text 張三在北京的云圖科技擔(dān)任CTO李四負(fù)責(zé)智譜數(shù)據(jù)。 words jieba.lcut(text) print(words)[張三, 在, 北京, 的, 云圖科技, 擔(dān)任, CTO, , 李四, 負(fù)責(zé), 智譜數(shù)據(jù), 。]分詞結(jié)果里能看到實(shí)體詞已經(jīng)被正確切分。基于規(guī)則抽取的優(yōu)點(diǎn)是快、透明、無需標(biāo)注數(shù)據(jù)缺點(diǎn)是詞典覆蓋不全新增實(shí)體要維護(hù)詞典。7.2 基于 spaCy 的實(shí)體抽取spaCy 中文模型可以識別預(yù)定義實(shí)體類型例如人名、組織、地名。先加載模型import spacy nlp spacy.load(zh_core_web_sm) text 張三在云圖科技擔(dān)任CTO工作地點(diǎn)在北京。 doc nlp(text) for ent in doc.ents: print(ent.text, ent.label_)輸出類似張三 PERSON 云圖科技 ORG 北京 GPE這種方式不需要維護(hù)詞典但中文模型默認(rèn)識別效果有限需要根據(jù)業(yè)務(wù)數(shù)據(jù)做調(diào)整或微調(diào)。所以實(shí)際項(xiàng)目里常常是規(guī)則 模型 詞典混合使用。7.3 從文本中提取三元組實(shí)體抽取只是得到實(shí)體關(guān)系抽取才是更關(guān)鍵的一步。關(guān)系抽取最簡單的實(shí)現(xiàn)方式是在文本中匹配預(yù)定義關(guān)系觸發(fā)詞relation_rules { 就職于: [擔(dān)任, 就職于, 任職], 位于: [位于, 坐標(biāo), 在], 投資: [投資, 入股, 持股], } def extract_triples(text): triples [] for head_entity in [張三, 李四, 王五]: for relation, keywords in relation_rules.items(): for keyword in keywords: if keyword in text and head_entity in text: tail_entity find_tail_entity(text, keyword) if tail_entity: triples.append((head_entity, relation, tail_entity)) return triples這只是一個(gè)示意實(shí)際關(guān)系抽取需要結(jié)合句法分析、依存句法或大模型提示詞來做。更可靠的方式是利用 SpaCy 的依存句法分析找到句子主謂賓。利用大模型從句子中抽取(subject, relation, object)返回 JSON再用規(guī)則校驗(yàn)。構(gòu)建自己的標(biāo)注數(shù)據(jù)集訓(xùn)練一個(gè)小模型。在入門階段先用規(guī)則跑通后續(xù)再升級。7.4 實(shí)體鏈接概念抽取出的實(shí)體可能有多義性比如“北京”可能指城市也可能指公司名稱里的“北京某某有限公司”。實(shí)體鏈接是把文本中的實(shí)體指稱映射到知識圖譜中的標(biāo)準(zhǔn)節(jié)點(diǎn)。入門階段可以在數(shù)據(jù)寫入時(shí)用統(tǒng)一的實(shí)體 ID 或?qū)傩詣e名處理比如節(jié)點(diǎn)加alias屬性查詢時(shí)用別名匹配。8. Cypher 查詢與知識圖譜可視化8.1 查詢示例寫入數(shù)據(jù)后驗(yàn)證數(shù)據(jù)是否正確最直接的方式是用 Cypher 查詢。查詢所有公司MATCH (c:Company) RETURN c.name AS company查詢“張三”的所有關(guān)系MATCH (p:Person {name: 張三})-[r]-(n) RETURN p.name, type(r), n.name查詢“云圖科技”的所有員工MATCH (p:Person)-[:WORKS_AT]-(c:Company {name: 云圖科技}) RETURN p.name查詢“張三任職的公司”MATCH (p:Person {name: 張三})-[:就職于]-(c:Company) RETURN c.name查詢路徑比如“張三”和“云圖科技”之間的路徑MATCH path (p:Person {name: 張三})-[*1..3]-(n) RETURN path LIMIT 208.2 通過 Python 查詢用 Python 執(zhí)行 Cypher 并返回 DataFrameimport pandas as pd from neo4j import GraphDatabase driver GraphDatabase.driver(bolt://localhost:7687, auth(neo4j, your_password)) def query_cypher(cypher, paramsNone): with driver.session() as session: result session.run(cypher, params) records result.data() return pd.DataFrame(records) df query_cypher( MATCH (p:Person)-[r]-(n) RETURN p.name AS person, type(r) AS relation, n.name AS target ) print(df)8.3 可視化的幾種方式Neo4j Browser 是最快的可視化方式輸入MATCH (n) RETURN n LIMIT 100就能看到圖譜節(jié)點(diǎn)和關(guān)系。如果要做更復(fù)雜的前端展示常用方案有d3.js / ECharts 關(guān)系圖把 Neo4j 查詢結(jié)果轉(zhuǎn)成 JSON用前端渲染。Gephi 做離線大規(guī)模圖譜分析。Neo4j Bloom商業(yè)版適合業(yè)務(wù)人員使用。騰訊開源的 Graphin適合 React 項(xiàng)目做圖分析。入門階段不需要自己寫前端Neo4j Browser 足夠用來驗(yàn)收結(jié)果。9. 知識圖譜問答系統(tǒng)實(shí)戰(zhàn)問答系統(tǒng)是本套實(shí)戰(zhàn)的高潮部分。最常見的實(shí)現(xiàn)方式是用戶輸入自然語言問題例如“張三在哪家公司任職”。通過規(guī)則或模型識別問題中的實(shí)體和意圖。把實(shí)體和意圖映射成 Cypher 查詢。執(zhí)行查詢返回結(jié)果給用戶。這里先做一個(gè)基于規(guī)則的最小問答系統(tǒng)優(yōu)點(diǎn)是可控、不需要訓(xùn)練數(shù)據(jù)適合初學(xué)理解整體流程。9.1 基于規(guī)則的問答系統(tǒng)from neo4j import GraphDatabase driver GraphDatabase.driver(bolt://localhost:7687, auth(neo4j, your_password)) def answer_question(question): # 1. 意圖規(guī)則包含“任職”“就職”等詞識別為查公司 if 任職 in question or 就職 in question or 工作 in question: # 2. 簡單實(shí)體識別從問題中匹配已知人名 entities [張三, 李四, 王五] entity None for name in entities: if name in question: entity name break if not entity: return 未識別到人名 # 3. 構(gòu)造 Cypher cypher MATCH (p:Person {name: $name})-[:就職于]-(c:Company) RETURN c.name AS company with driver.session() as session: result session.run(cypher, nameentity) records result.data() if not records: return f{entity} 未找到任職公司 companies [r[company] for r in records] return f{entity} 任職的公司有{, .join(companies)} if 擔(dān)任 in question: # 查詢職位 entities [張三, 李四, 王五] entity None for name in entities: if name in question: entity name break cypher MATCH (p:Person {name: $name}) RETURN p.position AS position with driver.session() as session: result session.run(cypher, nameentity) records result.data() if records and records[0][position]: return f{entity} 的職位是 {records[0][position]} return f{entity} 未找到職位信息 return 暫時(shí)只能回答任職和職位相關(guān)的問題測試print(answer_question(張三在哪家公司任職)) print(answer_question(李四擔(dān)任什么職位))張三 任職的公司有云圖科技 李四 的職位是 CEO這個(gè)問答系統(tǒng)雖然是規(guī)則版但已經(jīng)具備完整鏈路問題 - 意圖識別 - 實(shí)體抽取 - Cypher 查詢 - 答案。你可以在它的基礎(chǔ)上擴(kuò)展更多意圖和關(guān)系比如“誰和誰是同學(xué)”“某公司投資了哪些公司”。9.2 使用 FastAPI 封裝問答接口為了讓問答系統(tǒng)能被外部調(diào)用用 FastAPI 封裝一個(gè)接口pip install fastapi uvicornfrom fastapi import FastAPI from pydantic import BaseModel from neo4j import GraphDatabase app FastAPI() driver GraphDatabase.driver(bolt://localhost:7687, auth(neo4j, your_password)) class Question(BaseModel): question: str def answer(question: str) - str: if 任職 in question or 就職 in question: entities [張三, 李四, 王五] entity next((name for name in entities if name in question), None) if not entity: return 未識別到人名 cypher MATCH (p:Person {name: $name})-[:就職于]-(c:Company) RETURN c.name AS company with driver.session() as session: records session.run(cypher, nameentity).data() companies [r[company] for r in records] return f{entity} 任職的公司有{, .join(companies)} if companies else f{entity} 未找到任職公司 return 暫不支持該問題 app.post(/ask) def ask(question: Question): return {answer: answer(question.question)}啟動接口服務(wù)uvicorn main:app --host 0.0.0.0 --port 8000測試curl -X POST http://127.0.0.1:8000/ask \ -H Content-Type: application/json \ -d {question: 張三在哪家公司任職}{answer:張三 任職的公司有云圖科技}到這里知識圖譜問答系統(tǒng)的接口鏈路就跑通了。后續(xù)可以把接口接到智能客服機(jī)器人、微信公眾號、網(wǎng)頁對話框等場景中。9.3 規(guī)則問答的局限規(guī)則問答只能處理提前設(shè)計(jì)好的意圖和實(shí)體。實(shí)際問答場景中用戶表達(dá)五花八門比如“張三現(xiàn)在在哪個(gè)公司上班”“云圖科技的 CTO 是誰”都需要更多規(guī)則或者模型支持。進(jìn)階方向是使用 FastText、BERT 等模型做意圖分類。使用命名實(shí)體識別模型抽取問題中的實(shí)體。使用基于 Transformer 的序列標(biāo)注模型做關(guān)系抽取。使用 ChatGPT 類大模型把自然語言轉(zhuǎn)換成 Cypher但輸出不穩(wěn)定需要校驗(yàn)。使用大模型做答案生成把圖譜查詢結(jié)果作為上下文實(shí)現(xiàn)可解釋的問答。10. 資源占用與性能觀察Neo4j 是 Java 應(yīng)用占用內(nèi)存和 JVM 配置有關(guān)。默認(rèn)堆內(nèi)存配置可以通過neo4j.conf修改# 堆內(nèi)存根據(jù)機(jī)器內(nèi)存調(diào)整 server.memory.heap.initial_size512m server.memory.heap.max_size1G # 頁面緩存用于緩存節(jié)點(diǎn)和關(guān)系 server.memory.pagecache.size512m啟動 Neo4j 后可以用以下命令查看進(jìn)程占用jps -l top -p $(pgrep -f neo4j)在 Windows 上打開任務(wù)管理器查看 Java 進(jìn)程即可。Python 連接 Neo4j 時(shí)連接的資源并不高只要不頻繁創(chuàng)建和銷毀 Driver保持單例即可。批量寫入時(shí)要注意 Batch 大小如果一次寫入數(shù)據(jù)集很大可能導(dǎo)致事務(wù)超時(shí)建議每批 500 到 1000 條提交一次事務(wù)。10.1 性能優(yōu)化建議大批量導(dǎo)入用LOAD CSV不要用 Python 逐條插入。高頻查詢的節(jié)點(diǎn)屬性要?jiǎng)?chuàng)建索引。例如按姓名查詢創(chuàng)建索引CREATE INDEX person_name_index IF NOT EXISTS FOR (p:Person) ON (p.name);關(guān)系類型不要設(shè)計(jì)過多盡量控制在 10 種以內(nèi)方便維護(hù)。查詢時(shí)使用LIMIT限制返回?cái)?shù)量避免大結(jié)果集拖垮瀏覽器。Cypher 中避免全庫MATCH (n)掃描除非數(shù)據(jù)量很小。11. 常見問題與排查方法問題現(xiàn)象可能原因排查方式解決方案Neo4j 安裝后啟動失敗提示內(nèi)存不足JVM 堆或 pagecache 配置過大查看日志logs/neo4j.log調(diào)小堆內(nèi)存和 pagecache重啟服務(wù)瀏覽器訪問 7474 無響應(yīng)服務(wù)未啟動或端口被占用bin/neo4j status檢查端口啟動服務(wù)或修改dbms.connector.http.portPython 連接報(bào)AuthorizationError用戶名或密碼錯(cuò)誤在 Browser 中測試登錄重新設(shè)置密碼或者檢查認(rèn)證配置Python 連接報(bào)ConnectionRefusedNeo4j 未啟動或 Bolt 端口被改檢查 7687 端口啟動服務(wù)或修改連接 URI中文數(shù)據(jù)存入后亂碼CSV 編碼不是 UTF-8用文本編輯器查看 CSV 編碼轉(zhuǎn)換為 UTF-8 編碼后重新導(dǎo)入導(dǎo)入數(shù)據(jù)時(shí)LOAD CSV找不到文件CSV 不在 import 目錄查看 Neo4j 安裝目錄下的import文件夾把 CSV 放到$NEO4J_HOME/import目錄查詢結(jié)果為空數(shù)據(jù)未寫入或?qū)傩悦黄ヅ銪rowser 中用MATCH (n) RETURN n LIMIT 50查看檢查節(jié)點(diǎn)標(biāo)簽和屬性名Cypher 關(guān)系類型包含中文時(shí)語法錯(cuò)誤中文字符需要反引號查看錯(cuò)誤日志寫為[:\就職于]或用無中文關(guān)系類型批量寫入速度慢每條數(shù)據(jù)一個(gè)事務(wù)查看 Python 腳本日志使用LOAD CSV或批量 Batch 提交事務(wù)問答系統(tǒng)接口返回 500Cypher 執(zhí)行出錯(cuò)或 Python 異常查看 FastAPI 日志檢查代碼中的參數(shù)類型和格式neo4j.conf 修改后不生效配置位置不對或服務(wù)未重啟檢查配置文件路徑修改后重啟 Neo4j 服務(wù)這里特別說一個(gè)常見坑中文關(guān)系類型。Neo4j 支持中文關(guān)系類型但某些版本或客戶端在解析時(shí)可能報(bào)錯(cuò)穩(wěn)妥做法是在寫入和查詢時(shí)使用反引號或者直接使用英文關(guān)系類型例如WORKS_AT、HOLDS_POSITION。另一個(gè)常見問題py2neo和neo4j官方 Driver 混用。如果只想做入門演示選一個(gè)即可不要兩套混用否則依賴和事務(wù)邏輯容易混亂。12. 最佳實(shí)踐與使用建議如果是第一次跑知識圖譜項(xiàng)目不要一上來就追求大模型、海量數(shù)據(jù)和復(fù)雜前端。建議按下面的節(jié)奏來。先構(gòu)造一份 20 條關(guān)系以內(nèi)的樣例數(shù)據(jù)包含 3 種節(jié)點(diǎn)、3 種關(guān)系寫入 Neo4j。然后用 Cypher 查詢驗(yàn)證每個(gè)關(guān)系都能被正確查出。接著寫文本實(shí)體抽取把 10 條新聞或公告文本抽取出三元組。再把這些三元組寫入圖譜最后用規(guī)則問答系統(tǒng)回答幾個(gè)能命中的問題。這個(gè)過程跑通后再考慮擴(kuò)展意圖識別換成模型。實(shí)體抽取換成 spaCy 或大模型。問答接口接入前端頁面。導(dǎo)入真實(shí)業(yè)務(wù)數(shù)據(jù)時(shí)先做脫敏。工程上還有幾個(gè)建議模型文件、數(shù)據(jù)文件、代碼、輸出結(jié)果分目錄管理。推薦結(jié)構(gòu)kg_project/ ├── data/ │ ├── raw/ │ └── processed/ ├── scripts/ │ ├── import_data.py │ ├── entity_extract.py │ └── qa_server.py ├── config/ │ └── neo4j_config.py └── output/把 Neo4j 連接信息放到配置文件或環(huán)境變量中不要寫死在代碼里。import os NEO4J_URI os.getenv(NEO4J_URI, bolt://localhost:7687) NEO4J_USER os.getenv(NEO4J_USER, neo4j) NEO4J_PASSWORD os.getenv(NEO4J_PASSWORD, your_password)批量任務(wù)一定要加日志和失敗重試。因?yàn)橹R圖譜寫入過程中如果某條關(guān)系失敗后面事務(wù)回滾沒有日志很難定位。接口服務(wù)要限制訪問范圍。公網(wǎng)部署的話不要把 Bolt 和 HTTP 端口直接暴露建議加訪問令牌或放在內(nèi)網(wǎng)。FastAPI 接口可以加簡單的 API Key 校驗(yàn)。涉及人臉、聲音、版權(quán)素材、企業(yè)機(jī)密數(shù)據(jù)時(shí)必須確認(rèn)授權(quán)。這里雖然是技術(shù)入門但邊界意識要提前建立。13. 總結(jié)與下一步整個(gè)鏈路實(shí)際驗(yàn)證下來最值得先試的環(huán)節(jié)是 Neo4j 安裝 樣例數(shù)據(jù)寫入。先把圖數(shù)據(jù)庫跑起來看到 Browser 里的節(jié)點(diǎn)和關(guān)系你對知識圖譜的感知會發(fā)生質(zhì)變。接著把 Python 的實(shí)體抽取和 Cypher 查詢串起來問答系統(tǒng)反而是最容易出成就感的一步。最容易踩的坑有三個(gè)一是 Neo4j 版本和 Java 版本不匹配導(dǎo)致啟動失敗二是中文關(guān)系類型導(dǎo)致 Cypher 報(bào)錯(cuò)三是LOAD CSV文件路徑和編碼問題。這三個(gè)坑避開后面基本順暢。后續(xù)可以擴(kuò)展的方向很多。比如把 Neo4j 查詢結(jié)果接進(jìn)大模型讓大模型基于圖譜做回答在實(shí)體抽取環(huán)節(jié)用更成熟的序列標(biāo)注模型在前端用 ECharts 或 Graphin 做可視化分析。也可以結(jié)合 LLM 做智能客服的上下文記憶讓問答系統(tǒng)不再局限于固定規(guī)則。建議收藏備用動手的時(shí)候按“裝庫 - 建圖 - 寫數(shù)據(jù) - 查詢 - 問答”的順序走先把最小鏈路跑通再逐步增加復(fù)雜度。