Hyper-Extract--一个强大的命令行工具,能将非结构化的文本文档(如PDF、Markdown)通过大语言模型(LLM)转化为结构化的知识,包括知识图谱、超图、时空图等多种形式
这份详细的部署教程将指引您安装和使用 Hyper-Extract——一个强大的命令行工具,能将非结构化的文本文档(如PDF、Markdown)通过大语言模型(LLM)转化为结构化的知识,包括知识图谱、超图、时空图等多种形式。
Hyper-Extract 的核心价值在于其一键式的复杂知识提取能力。您无需编写代码,只需通过一个命令,就可以从海量文本中提取出实体、关系、事件和时间/空间信息,并构建成交互式的知识结构,方便后续查询、分析和可视化。
整个部署流程非常简单,主要包括安装工具、配置 LLM 提供商、以及运行解析命令。
📥 安装
Hyper-Extract 推荐使用 uv 或 pipx 进行安装,以获得独立的命令行环境。
1 | # 1. 安装 uv (如果尚未安装) |
⚙️ 配置 LLM 提供商
Hyper-Extract 需要配置大语言模型(LLM)来驱动提取过程。您需要选择一个受支持的提供商并配置 API 密钥。
1. OpenAI (推荐,同时提供 LLM 和 Embedding 模型)
1 | he config init -p openai -k YOUR_OPENAI_API_KEY |
2. Anthropic Claude (仅 LLM,需配对 OpenAI Embedding)
1 | # 设置 Claude 作为 LLM |
注意:使用 Anthropic 需要额外安装依赖:
pip install 'hyperextract[anthropic]'。
3. DeepSeek (性价比高,仅 LLM)
1 | he config llm -p deepseek -k YOUR_DEEPSEEK_API_KEY |
4. 阿里云百炼 (Bailian)
1 | he config init -p bailian -k YOUR_BAILIAN_API_KEY |
5. 本地 vLLM (完全离线,需 GPU)
1 | he config llm -p vllm -u http://localhost:8000/v1 -k dummy -m Qwen/Qwen3.5-9B |
🚀 核心使用流程
配置完成后,您可以使用 he parse 命令从文档中提取知识。
1. 从文档提取知识图谱
1 | # 使用通用传记图谱模板,从 tesla.md 文件中提取知识 |
2. 查询提取的知识
1 | # 对生成的 Knowledge Abstract (KA) 进行自然语言查询 |
3. 可视化知识图谱
1 | # 在浏览器中打开交互式图谱 |
4. 导出为 Obsidian 笔记库
1 | # 将图谱转化为 Obsidian 风格的 Markdown 笔记,并使用 [[wikilinks]] 链接 |
🎯 应用场景与模板
Hyper-Extract 提供了 80+ 种预定义的 YAML 模板,覆盖金融、法律、医疗、通用等多个领域,您可以零代码直接使用。
研究者:将学术论文转化为概念、作者和引用关系的知识图谱。
1
he parse paper.pdf -t general/academic_graph -o ./paper_kb/
金融分析师:从财报中自动提取公司、高管和财务指标及其关系。
1
he parse earnings.md -t finance/earnings_graph -o ./finance_kb/
🔌 高级功能:MCP 服务器
Hyper-Extract 还提供了一个 MCP (模型上下文协议) 服务器,允许 Claude Desktop 或 IDE 代理等工具直接查询您提取的知识摘要。
1 | # 安装 MCP 扩展 |








