《魁拔之书》世界观知识图谱(LLM 抽取 + 智能体校验)

从《魁拔之书》(卷一/卷二)中文文本自动构建的世界观知识图谱:1624 实体 / 3555 语义关系,由多阶段 LLM 管线抽取、再经 ReAct 校验智能体逐段落比对原文修正(权重/描述修订/时序补全)。

构建方法

由开源框架 lorebase 生成,流程:

  1. 结构化切片:章节边界切 566 块(~500 字,尾段重叠,块头上下文)
  2. 实体词典:LLM 逐单元抽取 + 泛称词扇出清洗 + LLM 语义归并(1339 词)
  3. 图谱抽取:词典候选 + 关系三元组抽取 + gleaning 补漏,14 类关系白名单
  4. 智能体校验:ReAct 智能体逐 chunk 比对「原文 ↔ 图谱子图 ↔ 向量召回」,写回硬权重(访问)、软权重(评价)、描述修订(321 实体)、时序区间(72 节点/177 关系)

文件与字段

nodes.jsonl(1624 行)

字段 说明
name 实体规范主名(唯一)
type person/race/faction/location/item/concept/event
aliases 别名(词典层归并)
description 一句话描述(跨块累积,经智能体修订)
hard_weight 校验智能体访问计数(事实性/关注度信号)
soft_weight 智能体评价净值(质量信号,负值=高置信疑点)
description_history 描述修订史 [{by, at, trace, text_old}]
desc_evidence 当前描述的原文证据
valid_from/valid_to 时序区间(纪元年整数,负数=纪元前)
source_chunks 出处块 id 列表

relationships.jsonl(3555 行)

字段 说明
head/tail 实体规范主名
rel 14 类白名单关系(MEMBER_OF/LEADER_OF/ENEMY_OF/ALLY_OF/PARENT_OF/TEACHER_OF/LOCATED_IN/OWNS/PARTICIPATES_IN/CREATED/KILLED/INCARNATION_OF/MASTERS/RELATED_TO)
evidence 原文证据短句(≤60 字)
source 出处 chunk_id 或 agent(智能体校验补充)
year 纪元年(负数=纪元前)
valid_from/valid_to 关系成立区间

chunks_index.jsonl(126 行)

chunk_id → 章节路径索引(关系 source 字段的寻址表;正文不含)。

质量说明

  • 全量校验 561/566 chunk(99.8%),4891 条判定(valid 79.2% / rel_missing 5.7% / quality_bad 2.7%)
  • 343 条关系为智能体依据原文补全(带证据);518 条关系含年份
  • 已知局限:53 实体无类型标注;抽取错误难以完全避免,soft_weight 为负的实体(21 个)为高置信疑点池

免责声明

  • 本数据集为非官方的爱好者研究项目,与《魁拔之书》作者、出版方及青青树公司无任何关联
  • 数据由 LLM 从原著文本自动抽取并经智能体校验,不保证与原著完全一致,仅供自然语言处理/知识图谱研究用途
  • 数据集不含原著正文,仅含实体/关系结构化描述与 ≤60 字的原文证据短句(引用范畴);禁止商用(CC BY-NC 4.0)
  • 如版权方认为本数据集不适当,将在接到通知后立即下架

引用

@dataset{kuiba-worldview-kg,
  title  = {Kuiba Worldview Knowledge Graph (LLM-extracted, agent-validated)},
  author = {ppw2004},
  year   = {2026},
  url    = {https://huggingface.co/datasets/ppw2004/kuiba-worldview-kg}
}

构建框架:ppw2004/lorebase(Apache-2.0)

Downloads last month

-

Downloads are not tracked for this model. How to track
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support