《魁拔之书》世界观知识图谱(LLM 抽取 + 智能体校验)
从《魁拔之书》(卷一/卷二)中文文本自动构建的世界观知识图谱:1624 实体 / 3555 语义关系,由多阶段 LLM 管线抽取、再经 ReAct 校验智能体逐段落比对原文修正(权重/描述修订/时序补全)。
构建方法
由开源框架 lorebase 生成,流程:
- 结构化切片:章节边界切 566 块(~500 字,尾段重叠,块头上下文)
- 实体词典:LLM 逐单元抽取 + 泛称词扇出清洗 + LLM 语义归并(1339 词)
- 图谱抽取:词典候选 + 关系三元组抽取 + gleaning 补漏,14 类关系白名单
- 智能体校验:ReAct 智能体逐 chunk 比对「原文 ↔ 图谱子图 ↔ 向量召回」,写回硬权重(访问)、软权重(评价)、描述修订(321 实体)、时序区间(72 节点/177 关系)
文件与字段
nodes.jsonl(1624 行)
| 字段 | 说明 |
|---|---|
name |
实体规范主名(唯一) |
type |
person/race/faction/location/item/concept/event |
aliases |
别名(词典层归并) |
description |
一句话描述(跨块累积,经智能体修订) |
hard_weight |
校验智能体访问计数(事实性/关注度信号) |
soft_weight |
智能体评价净值(质量信号,负值=高置信疑点) |
description_history |
描述修订史 [{by, at, trace, text_old}] |
desc_evidence |
当前描述的原文证据 |
valid_from/valid_to |
时序区间(纪元年整数,负数=纪元前) |
source_chunks |
出处块 id 列表 |
relationships.jsonl(3555 行)
| 字段 | 说明 |
|---|---|
head/tail |
实体规范主名 |
rel |
14 类白名单关系(MEMBER_OF/LEADER_OF/ENEMY_OF/ALLY_OF/PARENT_OF/TEACHER_OF/LOCATED_IN/OWNS/PARTICIPATES_IN/CREATED/KILLED/INCARNATION_OF/MASTERS/RELATED_TO) |
evidence |
原文证据短句(≤60 字) |
source |
出处 chunk_id 或 agent(智能体校验补充) |
year |
纪元年(负数=纪元前) |
valid_from/valid_to |
关系成立区间 |
chunks_index.jsonl(126 行)
chunk_id → 章节路径索引(关系 source 字段的寻址表;正文不含)。
质量说明
- 全量校验 561/566 chunk(99.8%),4891 条判定(valid 79.2% / rel_missing 5.7% / quality_bad 2.7%)
- 343 条关系为智能体依据原文补全(带证据);518 条关系含年份
- 已知局限:53 实体无类型标注;抽取错误难以完全避免,
soft_weight为负的实体(21 个)为高置信疑点池
免责声明
- 本数据集为非官方的爱好者研究项目,与《魁拔之书》作者、出版方及青青树公司无任何关联
- 数据由 LLM 从原著文本自动抽取并经智能体校验,不保证与原著完全一致,仅供自然语言处理/知识图谱研究用途
- 数据集不含原著正文,仅含实体/关系结构化描述与 ≤60 字的原文证据短句(引用范畴);禁止商用(CC BY-NC 4.0)
- 如版权方认为本数据集不适当,将在接到通知后立即下架
引用
@dataset{kuiba-worldview-kg,
title = {Kuiba Worldview Knowledge Graph (LLM-extracted, agent-validated)},
author = {ppw2004},
year = {2026},
url = {https://huggingface.co/datasets/ppw2004/kuiba-worldview-kg}
}
构建框架:ppw2004/lorebase(Apache-2.0)
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support