github.com/YunyueLi/LoreGraph
凭空生成的关系,一条都不要。
I. 封面图版 Design for a theater set,大都会艺术博物馆 001 / 007
为虚构作品建立证据锚定的知识图谱

知识图谱里的每一句话,都能翻回它出处的那一页

LoreGraph 把小说、戏剧、剧本、歌剧脚本变成一张可查询的图谱:人物、物件、事件、概念,以及它们之间的有类型关系。每条断言都带一个 evidence_span点开任意一条关系就落到它出处的那一句。

85 部作品参考语料
11 种语言从源文到界面
08 轮抽取其中一轮是闸门
↳   uv sync   →   loregraph extract 八轮抽取,一道闸门
Israel Silvestre,1654 The Met, CC0 字面匹配  ≥ 95% 图版:Design for a theater set created by Giacomo Torelli da Fano for the ballet 'Les Noces de Thétis'.
01切分 02抽取 03校验 04成卡
II. 规则 docs/8-pass-pipeline.md 002 / 007
规则

一张会悄悄编造关系的图谱,比没有图谱更糟。

多数从文本里抽知识图谱的工具,抽完三元组就让你相信它。对虚构作品来说这是致命的。LoreGraph 只守一条规则:每条抽取出的断言都带一个 evidence_span也就是原文的字面子串;校验轮会丢弃字面匹配不到 95% 的断言。

读流程规格
图版:Sphaera Mundi(大都会艺术博物馆,CC0,经拼贴处理)
模型只被允许使用
眼前这段文本。
它被明确告知:
忘掉你知道的
那个孙悟空。
闭世界抽取:每条断言都能回到书里的一句话。 (Sphaera Mundi,1485。大都会艺术博物馆,CC0)
III. 工程 src/loregraph 003 / 007
图版:New Inventions of Modern Times [Nova Reperta], The Invention of Book Printing, plate 4(大都会艺术博物馆,CC0,经拼贴处理)
LOREGRAPH     8-PASS PIPELINE
工程

证据严格,对模型宽松。

读 Splink、ComEM 与 GraphRAG 定下了四件事:字面证据闸门、跨字符集可用的实体消解、按轮提交与幂等重跑,以及不绑定单一厂商的模型客户端。

01证据

每条断言
都给出出处

抽取过程中就写入 evidence_span校验轮丢弃字面匹配不到 95% 的断言。

02闭世界

只读眼前
这段文本

模型被要求忘掉它知道的伊丽莎白·班纳特或孙悟空,只报告这本书说了什么。

03多语种

跨字符集
合并同一实体

实体消解跑在 multilingual-e5-large 上,林黛玉与颦儿零字符重叠也能并成一个节点。

04可换后端

一把 key
换任意模型

默认走 OpenRouter 上的 DeepSeek V4 Pro,可切换到 15 个以上后端;Anthropic 走原生接口并复用提示缓存。

IV. 阅读室 src/loregraph/web 004 / 007
阅读室

一本书,五个视图,底下是同一张图谱

05
五个视图 Reader、Graph、Timeline、
Index 与 Ask 读的
是同一张图谱。
文本图版:Manuscript Leaf with text in Bolorgir(大都会艺术博物馆,CC0,经拼贴处理)
01已上线

Reader 原文

原始文本,每一处实体提及都高亮且可点。

图谱图版:The Celestial Map- Northern Hemisphere(大都会艺术博物馆,CC0,经拼贴处理)
02已上线

Graph 关系网

人物、物件、事件、概念的力导向网络。悬停任一条边,看它出处那一行。

时序图版:Bamboo and the Thousand-Character Classic(大都会艺术博物馆,CC0,经拼贴处理)
03已上线

Timeline 事件线

按阅读顺序排列的事件。图谱在每条事实上都带故事时间位置。

索引图版:Alphabet Letters (5 Vowels)(大都会艺术博物馆,CC0,经拼贴处理)
04已上线

Index 实体目录

可搜索的实体目录,每个实体一张档案卡,事实与推断分栏。

问答图版:Terracotta bell-krater (bowl for mixing wine and water)(大都会艺术博物馆,CC0,经拼贴处理)
05已上线

Ask 图谱问答

基于图谱的问答,每个答案都给出它的证据。

五个视图都在 src/loregraph/web     看源码 →
V. 流程 八轮 005 / 007
流程

八轮,从一段原文,到一条你可以亲自核对的断言。

+

第 1、4 轮是确定性的,第 2、3、5、6、8 轮调模型,第 7 轮是闸门而不是建议。每轮各自提交,失败的一次用 --from N 续跑,不会重复写入。

01

切分

确定性的章节感知切分,英文标题与「第N回」一样能识别。每个 chunk 都带一个全局故事时间位置。

图版:Manuscript Leaf from a Royal Psalter(大都会艺术博物馆,CC0,经拼贴处理)
02

抽取

抽有类型的提及,做实体消解(词面加向量 kNN 分块,再批量匹配)、共指、五类关系,以及它们隐含的常识事实。

图版:Neu inventiert genealogischer Stamm-Baum der Griechisch Kayser.
03

校验

chain-of-verification。证据跨度对不上原文字面的断言在这里被丢掉,门槛是 95%。

图版:Fragmentary marble inscription(大都会艺术博物馆,CC0,经拼贴处理)
04

成卡

每个实体合成一张 Hybrid Note:事实与推断分栏,每条推断标注置信度,并给出子类型与重要性层级。

图版:Bookbinding (Jild-i kitab)(大都会艺术博物馆,CC0,经拼贴处理)
文本里没有的,不进图谱。
VII. 上手 Apache-2.0 007 / 007
上手

三条命令,你手上那本书就有了一张图谱

uv sync对着装了 pgvector 的 Postgres 16+ 跑 alembic upgrade head然后 loregraph ingestloregraph extract一把 OpenRouter key 就够。中等长度的长篇是分钟级而不是小时级,每本书还有 20 美元的预算上限,在轮次之间强制生效。

● Live v0.1.0-dev / Apache-2.0 八轮抽取,一道闸门
图版:Parte di ampio magnifico Porto all'uso degli antichi Romani, ove si scuopre l'interno della gran Piazza pel Comercio.
VII
LOREGRAPH     APACHE-2.0