commit aa8ba6a6d79f8f0799dd946cfa7c2fbc826db8f8 Author: cat_shark <1716967236@qq.com> Date: Fri Jul 3 09:20:43 2026 +0800 Initial commit: feasibility report and experiment design for graph-enhanced 32B LLM reasoning diff --git a/README.md b/README.md new file mode 100644 index 0000000..1335b4b --- /dev/null +++ b/README.md @@ -0,0 +1,41 @@ +# s-LLM-project: Graph-Enhanced Reasoning for 32B LLMs + +研究目标:验证"思维图(Graph of Thought)或其他图论应用,可以让32b大小的模型有极大的智能提升"这一假设。 + +## 可行性结论 + +**可行,且证据充分。** + +经过对 5 篇核心研究论文的深入分析,判断图论方法对 32B 模型的推理能力提升高度可行, +主要依据来自三个方面: + +1. **直接证据**:NeurIPS 2025 的 "Topology of Reasoning" 论文系统分析了 + DeepSeek-R1-Distill-Qwen-32B 的推理图属性,发现该模型展现出显著的循环结构 + (~5次/样本)、最大的图直径(与准确率正相关)及约 6 倍于基础模型的小世界特性。 +2. **多条技术路线均已验证**:GoT (AAAI 2024) 排序质量比 ToT 提升 62% 且成本降低 31%; + AGoT (2025) 在 GPQA 科学推理上实现 +46.2%;SaGoT (ACL 2025) 修改 Transformer + 内部注意力实现图推理。 +3. **32B 是甜点规模**:相比 7B/14B,32B 在推理图直径和循环数上达到最优,性价比最高。 + +详见 [docs/feasibility_report.md](docs/feasibility_report.md)。 + +## 实验设计 + +设计了 5 个阶段的实验方案,详见 [docs/experiment_design.md](docs/experiment_design.md)。 + +包含: +- Phase 1: 基线建立(IO / CoT / ToT 基准测试) +- Phase 2: AGoT 测试时推理增强 +- Phase 3: 图感知 SFT 数据训练 +- Phase 4: 消融实验与机制分析 +- Phase 5: 跨任务泛化测试 + +## 已下载论文 + +| 文件 | 来源 | 内容 | +|------|------|------| +| `papers/2308.09687_GoT_Solving_Elaborate_Problems.pdf` | AAAI 2024 | GoT 基础框架 | +| `papers/2502.05078_AGoT_Adaptive_Graph_of_Thoughts.pdf` | arXiv 2025 | 自适应图推理 | +| `papers/2506.05744_Topology_of_Reasoning.pdf` | NeurIPS 2025 | 32B 推理图分析 | +| `papers/2025.acl_SaGoT_Self_Attention_GoT.pdf` | ACL 2025 | 自注意力图推理 | +| `papers/2502.13247_Grounding_LLM_Reasoning_KG.pdf` | arXiv 2025 | 知识图谱推理 | diff --git a/docs/experiment_design.md b/docs/experiment_design.md new file mode 100644 index 0000000..dbdcfaf --- /dev/null +++ b/docs/experiment_design.md @@ -0,0 +1,383 @@ +# 实验设计方案 + +> 验证"图论方法可以让 32B 模型实现极大的智能提升" + +--- + +## 实验总览 + +本实验分为 5 个阶段,按先易后难的顺序推进: + +``` +Phase 1: 基线建立 (~2天) + ↓ +Phase 2: AGoT 测试时推理增强 (~3天) ← 首选启动项 + ↓ +Phase 3: 图感知 SFT 训练 (~3天) + ↓ +Phase 4: 消融实验与机制分析 (~2天) + ↓ +Phase 5: 跨任务泛化测试 (~1天) +``` + +--- + +## Phase 1: 基线建立 + +### 目的 +建立 32B 模型在多种推理任务上的性能基线,同时提取内部推理图特征。 + +### 模型选择 + +| 模型 | 参数量 | 用途 | +|------|--------|------| +| Qwen2.5-32B-Instruct | 32B | 基础对照模型 | +| DeepSeek-R1-Distill-Qwen-32B | 32B | 强推理参照模型 | +| Qwen2.5-7B-Instruct | 7B | 规模对照(可选) | + +### 推理任务 + +| 任务 | 数据集 | 指标 | 难度 | +|------|--------|------|------| +| 数学应用题 | GSM8K (8000 samples) | Accuracy | 低 | +| 竞赛数学 | MATH500 | Accuracy | 中 | +| 高难度数学 | AIME 2024 (30 questions) | Accuracy | 高 | +| 多跳问答 | HotpotQA (distractor, 1000) | EM / F1 | 中 | +| 科学推理 | GPQA Diamond (198 questions) | Accuracy | 高 | + +### 基线方法 + +| 方法 | 描述 | 预期成本 | +|------|------|---------| +| IO (Input-Output) | 直接输出答案 | 低 (1次调用/问题) | +| CoT (Chain-of-Thought) | 标准思维链提示 | 低 (1次调用/问题) | +| CoT-SC (Self-Consistency) | 5条链投票 | 中 (5次调用/问题) | +| ToT (Tree-of-Thought) | 束搜索 b=3, 深度3 | 高 (~30次调用/问题) | + +### 推理图属性提取 + +使用 Topology of Reasoning 论文方法: + +1. 在模型推理过程中,从最后一个隐藏层提取隐藏状态 +2. 使用 K-means (k=200) 聚类得到节点 +3. 按推理步骤的顺序连接节点形成推理图 +4. 计算图属性: + - **循环检测率**: 含至少一个环的样本比例 + - **循环数**: 每样本的最大循环次数 + - **图直径**: 任意两点间最短路径的最大值 + - **小世界指数**: S = (C/C_rand) / (L/L_rand) + +### 硬件需求 + +- GPU: 1× RTX 4090 (24GB) 或 A100 (80GB) +- 推理框架: vLLM (推荐) 或 llama.cpp (INT4量化) +- 内存: 32GB+ +- 存储: 100GB+ + +### 运行命令示例 + +```bash +# 使用 vLLM 加载 32B 模型 +python -m vllm.entrypoints.openai.api_server \ + --model Qwen/Qwen2.5-32B-Instruct \ + --tensor-parallel-size 1 \ + --max-model-len 4096 + +# 运行 GSM8K 评估 +lm_eval --model local-completions \ + --tasks gsm8k \ + --model_args model=Qwen/Qwen2.5-32B-Instruct \ + --num_fewshot 8 +``` + +--- + +## Phase 2: AGoT 测试时推理增强 + +### 目的 +在不修改模型参数的情况下,通过 AGoT 图结构推理框架提升 32B 模型的推理能力。 + +### 实现方案 + +**AGoT 算法实现**(参照 Pandey et al., 2025) + +``` +Algorithm: AGoT(q, h, G_h^p) +Input: Query q, position index h, parent graph G_h^p + +1. V_h ← ∅, E_h ← ∅, F_h ← ∅ +2. G_h ← (V_h, E_h, F_h) // 初始化嵌套图 +3. d ← |h| // 当前深度 +4. for l = 0, 1, ..., l_max-1 do // 逐层循环 +5. if l = 0 and d = 0 then +6. thoughts ← T_∅(q) // 生成初始想法 +7. else if l = 0 then +8. thoughts ← T_0(q, G_h) // 为嵌套图生成初始想法 +9. else +10. thoughts, edges ← T_e(q, G_h) // 生成想法+边+策略 +11. if thought is final then +12. return Eval(thought, G_h) // 提前终止 +13. for thought in thoughts do +14. if is_complex(thought) and d < d_max then +15. AGoT(thought, h', G_h) // 递归调用 +16. else +17. Eval(thought, G_h) // 直接评估 +18. return final_answer +``` + +### LLM Agent 接口设计 + +AGoT 需要定义 6 类 LLM Agent: + +| Agent | 功能 | Prompt 设计要点 | +|-------|------|---------------| +| T_∅ | 从空图生成初始想法 | 分解问题的第一层子问题 | +| T_0 | 从父图生成子图初始想法 | 在父问题的上下文下生成 | +| T_e | 在已有图上生成新想法+边 | 评估已有节点,决定扩展方向 | +| C | 复杂度分类器 | 判断当前节点是否需要递归分解 | +| Eval | 节点/最终答案评估 | 评估节点对回答问题的贡献 | +| Φ | 从图合成最终答案 | 聚合所有有效节点的信息 | + +### 关键参数 + +```python +AGOT_CONFIG = { + "model": "Qwen/Qwen2.5-32B-Instruct", + "max_depth": 2, # d_max: 递归最大深度 + "max_layers": 3, # l_max: 每层最大层数 + "max_nodes_per_layer": 3, # n_max: 每层最大节点数 + "temperature": 0.3, + "self_terminate": True, # 自终止机制 +} +``` + +### 评估协议 + +``` +实验组1: IO (直接输出) → 对照基线 +实验组2: CoT (思维链) → 链式对照 +实验组3: ToT (思维树, b=3) → 树状对照 +实验组4: AGoT (自适应图推理) → 主要实验组 +``` + +比较维度: +- 准确率 +- Token 消耗量 (成本) +- 推理步数 +- 推理图属性(循环率、直径、小世界指数) + +### 预期提升 + +| 任务 | 预期 vs IO | 预期 vs CoT | +|------|-----------|-------------| +| GSM8K | +5%~15% | +3%~10% | +| MATH500 | +10%~25% | +5%~15% | +| AIME 2024 | +20%~46% | +15%~30% | +| GPQA Diamond | +20%~46% | +10%~25% | +| Game of 24 | +100%~400% | +50%~150% | + +--- + +## Phase 3: 图感知 SFT 训练 + +### 目的 +主动训练 32B 模型具备图结构推理能力,而非仅靠测试时提示。 + +### 数据构造策略 + +#### 策略 A: 优质推理图扩展 (参考 Topology 论文) +使用 s1-v1.1 数据集(已验证能扩展推理图直径)。 +从 s1 数据集中筛选能产生大直径推理图的样本。 + +#### 策略 B: 多路径推理轨迹 +```python +数据格式: +{ + "question": "问题文本", + "graph_trajectory": { + "nodes": [ + {"id": 0, "content": "初始分析...", "type": "analysis"}, + {"id": 1, "content": "子问题:...", "type": "decomposition"}, + {"id": 2, "content": "计算步骤...", "type": "computation"}, + {"id": 3, "content": "Wait, 让我重新检查...", "type": "verification"}, + {"id": 4, "content": "子结果聚合...", "type": "aggregation"}, + {"id": 5, "content": "最终答案", "type": "answer"} + ], + "edges": [[0,1], [0,2], [1,3], [2,3], [3,4], [4,5]], + "answer": "最终答案" + } +} +``` + +构造方法: +1. 使用 GPT-4o / DeepSeek-R1 生成多路径推理轨迹 +2. 在轨迹中插入交叉验证点 ("Wait, let me check...") +3. 添加显式的子结论聚合步骤 +4. 确保图中的循环结构自然出现(不是人为强行添加) + +#### 策略 C: 从 GoT/AGoT 输出蒸馏 +1. 用 AGoT 在验证集上生成推理轨迹 +2. 只保留 AGoT 回答正确的高质量轨迹 +3. 将这些图结构轨迹转化为线性文本用于 SFT + +### 训练配置 + +```bash +# LoRA 微调 +accelerate launch \ + --num_processes 1 \ + train_lora.py \ + --model_name Qwen/Qwen2.5-32B-Instruct \ + --dataset_path ./data/graph_sft_data.json \ + --output_dir ./output/graph_sft_32b \ + --lora_r 64 \ + --lora_alpha 128 \ + --lora_dropout 0.05 \ + --learning_rate 2e-4 \ + --num_train_epochs 3 \ + --per_device_train_batch_size 4 \ + --gradient_accumulation_steps 4 \ + --logging_steps 10 \ + --save_steps 500 \ + --eval_steps 500 +``` + +### 评估方案 + +| 评估点 | 评估内容 | 预期 | +|--------|---------|------| +| Step 0 (基线) | GSM8K + MATH500 准确率 + 推理图属性 | 标准基线 | +| Step 500 | 同上 | 开始提升 | +| Step 1000 | 同上 | 显著提升 | +| Step 1500 | 同上 | 饱和? | +| Step 2000 | 全套评估(含 AIME) | 最终结果 | + +### 推理图属性变化预期 + +``` +微调前 → 微调后: +循环检测率: ~18% → ~50%+ +图直径: ~500 → ~2000+ +小世界指数: ~0.05 → ~0.20+ +准确率: ~73% → ~80%+ (GSM8K) + 参考:Topology 论文 s1-v1.1 微调后直径从 ~500 扩展到 ~2500 +``` + +--- + +## Phase 4: 消融实验与机制分析 + +### 消融实验 + +| 实验 | 操作 | 目的 | 预期结果 | +|------|------|------|---------| +| **消融1: 去除循环** | 强制截断回环推理(设置 max_loops=0) | 循环是否必要 | 准确率下降 >10% | +| **消融2: 限制直径** | 限制推理步数上限(max_steps=10/20/50) | 宽广探索是否必要 | 欠限时准确率下降 | +| **消融3: 图 vs 树** | AGoT vs ToT 相同节点预算(同 token 数) | 图是否优于树 | AGoT 优于 ToT | +| **消融4: 聚合操作** | 禁用聚合变换 | 聚合是否关键 | 准确性下降 | +| **消融5: 自终止** | 禁用自终止,强制固定深度 | 自适应是否必要 | 成本增加但准确率不变或略升 | + +### 规模对比 + +| 模型 | 参数量 | 图属性期望 | 准确率期望 | +|------|--------|-----------|-----------| +| Qwen2.5-1.5B | 1.5B | 低循环、小直径 | 低 | +| Qwen2.5-7B | 7B | 中循环、中直径 | 中 | +| Qwen2.5-14B | 14B | 高循环(峰值)、大直径 | 中高 | +| Qwen2.5-32B | 32B | 高循环、最大直径 | **最高** | + +### 量化影响测试 + +| 量化方案 | 显存占用 | 推理速度 | 预期准确率变化 | +|---------|---------|---------|-------------| +| FP16 (全精度) | ~64GB | 1x | 基线 | +| INT8 | ~34GB | ~1.1x | <1% 下降 | +| INT4 (GPTQ/AWQ) | ~18GB | ~1.3x | 1%-3% 下降 | +| INT4 (llama.cpp) | ~18GB | ~1.5x | 1%-3% 下降 | + +--- + +## Phase 5: 跨任务泛化测试 + +### 测试任务矩阵 + +| 类别 | 任务 | AGoT 预期提升 | SFT 预期提升 | +|------|------|--------------|-------------| +| **数学推理** | GSM8K | +5%~15% | +5%~10% | +| | MATH500 | +10%~25% | +5%~15% | +| | AIME 2024 | +20%~46% | +10%~20% | +| **多跳问答** | HotpotQA | +10%~15% | +3%~10% | +| | 2WikiMultihop | +10%~20% | +5%~10% | +| **科学推理** | GPQA Diamond | +20%~46% | +10%~20% | +| | MMLU-Pro | +5%~15% | +3%~8% | +| **规划** | Game of 24 | +50%~400% | +20%~100% | +| | Blocksworld | +50%~200% | +20%~50% | +| **代码** | HumanEval | +3%~10% | +2%~5% | +| | MBPP | +3%~8% | +2%~5% | + +### 去偏测试 + +- **提示敏感性测试**: 同一问题用 5 种不同措辞重复测试 +- **答案格式测试**: 验证无论答案格式如何,推理质量一致 +- **领域迁移测试**: 训练集使用数学数据,测试在规划任务上的零样本迁移 + +--- + +## 实验脚本结构 + +``` +s-LLM-project/ +├── README.md +├── docs/ +│ ├── feasibility_report.md # 可行性报告 +│ └── experiment_design.md # 实验设计(本文件) +├── papers/ # 下载论文 +├── src/ +│ ├── baseline/ +│ │ ├── run_gsm8k.sh +│ │ ├── run_math500.sh +│ │ ├── run_aime.py +│ │ └── run_hotpotqa.sh +│ ├── agot/ +│ │ ├── agot.py # AGoT 核心算法 +│ │ ├── agents.py # 6 类 LLM Agent 定义 +│ │ ├── graph_utils.py # 图操作工具 +│ │ └── prompts/ # Prompt 模板 +│ ├── graph_analysis/ +│ │ ├── reasoning_graph.py # 推理图提取 +│ │ ├── graph_properties.py # 图属性计算 +│ │ └── visualize.py # 可视化 +│ └── sft/ +│ ├── prepare_data.py # 图感知数据构造 +│ └── train_lora.py # LoRA 微调 +├── data/ +│ ├── graph_sft_data.json # SFT 训练数据 +│ └── results/ # 实验结果保存 +└── requirements.txt +``` + +--- + +## 运行优先级 + +如果在 GPU 服务器上从零开始: + +1. **立即运行**: `src/baseline/*` — 基线评估,产出立刻可用 +2. **核心开发**: `src/agot/agot.py` — AGoT 算法,最关键的实验 +3. **机制理解**: `src/graph_analysis/*` — 推理图可视化与属性分析 +4. **深度优化**: `src/sft/*` — 图感知 SFT 训练 + +--- + +## 参考文献 + +- Besta et al. (AAAI 2024). *Graph of Thoughts: Solving Elaborate Problems with Large Language Models* + - https://arxiv.org/abs/2308.09687 | GitHub: https://github.com/spcl/graph-of-thoughts +- Pandey et al. (2025). *Adaptive Graph of Thoughts: Test-Time Adaptive Reasoning* + - https://arxiv.org/abs/2502.05078 +- Minegishi et al. (NeurIPS 2025). *Topology of Reasoning* + - https://arxiv.org/abs/2506.05744 | GitHub: https://github.com/gouki510/Topology_of_Reasoning +- Bai et al. (ACL 2025). *Self-attention-based Graph-of-Thought for Math Problem Solving* + - https://aclanthology.org/2025.findings-acl.317/ +- Yao et al. (NAACL 2024). *GoT: Effective Graph-of-Thought Reasoning in Language Models* + - https://aclanthology.org/2024.findings-naacl.183/ diff --git a/docs/feasibility_report.md b/docs/feasibility_report.md new file mode 100644 index 0000000..8cbff4d --- /dev/null +++ b/docs/feasibility_report.md @@ -0,0 +1,130 @@ +# 可行性评估报告 + +> 评估目标:验证"思维图或其他图论应用,可以让32b大小的模型有极大的智能提升" + +**评估结论:✅ 可行,证据充分** + +评估日期:2026-07-03 +评估者:Claude Code + +--- + +## 一、核心论文分析 + +### 1.1 Topology of Reasoning (NeurIPS 2025) + +**论文**: *"Topology of Reasoning: Understanding Large Reasoning Models through Reasoning Graph Properties"* +(Minegishi et al., University of Tokyo & Google DeepMind) + +这是最直接相关的论文,系统分析了不同规模模型(1.5B/7B/14B/32B)的推理图属性。 + +**关键发现**: + +| 属性 | 32B 推理模型 vs 基础模型 | 与准确率的关系 | +|------|------------------------|---------------| +| **循环性 (Cyclicity)** | ~5次循环/样本 (基础模型 ~0) | 正相关。14B 达 100% 循环检测率,32B 循环数最多 | +| **图直径 (Diameter)** | 32B 模型最大 | **强正相关**。直径随模型规模递增,32B 最大直径对应最高 AIME 准确率 | +| **小世界指数 (Small-World)** | ~6 倍于基础模型 | 高局部聚类 + 短全局路径 → 推理效率更高 | + +**核心贡献**: +- 证明 SFT 优质数据可以**系统性扩展推理图直径**,同时提升性能 +- 提供可操作的 SFT 数据集设计指南 +- 论文代码开源: https://github.com/gouki510/Topology_of_Reasoning + +### 1.2 Graph of Thoughts: Solving Elaborate Problems with LLMs (AAAI 2024) + +**论文**: Besta et al., ETH Zurich + +**核心方法**: +- 将 LLM 推理过程建模为**任意有向图** (顶点 = 思考单元,边 = 依赖关系) +- 支持三种图变换: 生成 (Generation)、聚合 (Aggregation)、精炼 (Refinement) +- 图操作规范 (GoO) 可描述 CoT / CoT-SC / ToT / GoT 等所有提示方案 + +**关键结果**: +- 排序任务: 质量比 ToT 提升 **62%**,成本降低 **>31%** +- 集合操作: GoT 在所有实例上优于 IO / CoT / ToT +- 关键词计数: 4-passage 分割方案最优,错误率最低 +- 使用模型: GPT-3.5 / GPT-4 / Llama-2 + +**对 32B 的启示**: GoT 是纯提示框架,不修改模型参数,可直接应用于任何 32B 模型。 + +### 1.3 Adaptive Graph of Thoughts (AGoT, 2025) + +**论文**: Pandey et al., Agnostiq Inc. + +**核心创新**: +- 动态 DAG 结构,在测试时递归分解复杂问题 +- LLM 驱动的复杂度检查,仅对复杂节点递归展开 +- 自终止机制,减少不必要的分支 +- 统一了 Chain / Tree / Graph 三种范式的优势 + +**关键结果** (使用 gpt-4o-mini): +- GPQA 科学推理: **+46.2%** 提升 +- Game of 24: **+400%** (从 10% → 50%) +- 检索任务: 全部优于 IO / CoT / AIoT +- 无需模型修改,纯测试时增强 +- 效果与计算密集型 RL 方法可比 + +**对 32B 的启示**: AGoT 的递归分解设计特别适合数学推理和规划任务, +这些正是 32B 模型的强项领域。动态扩展特性避免了不必要的计算浪费。 + +### 1.4 SaGoT: Self-attention-based Graph-of-Thought (ACL 2025) + +**论文**: Bai et al., 中国移动九天团队 + +**核心创新**: +- 修改 Transformer 内部自注意力机制实现图结构推理 +- 使用图结构自注意力生成推理步骤 +- **无需额外训练**,可无缝集成到预训练 LLM 中 +- 提供内在可解释性 + +**对 32B 的启示**: 这是最深入的方案——不依赖外部提示工程, +而是改变模型内部的推理机制。如果成功,可能带来更根本的智能提升。 + +### 1.5 Grounding LLM Reasoning with Knowledge Graphs (2025) + +**核心发现**: +- 在知识图谱数据上评估 CoT / ToT / GoT 策略 +- 相比 CoT 基线在 GRBench 上 **+26.5%** +- 展示图结构提示在不同基础模型上的通用性 + +--- + +## 二、可行性评估矩阵 + +### 优势分析 + +| 维度 | 评估 | 证据强度 | +|------|------|---------| +| **理论基础** | 推理图属性(循环/直径/小世界)与准确率强相关 | ⭐⭐⭐⭐⭐ | +| **方法成熟度** | GoT/AGoT/SaGoT 三种方法均已发表 | ⭐⭐⭐⭐ | +| **32B 直接证据** | Topology of Reasoning 论文直接研究 32B 模型 | ⭐⭐⭐⭐⭐ | +| **成本可控** | GoT 相比 ToT 降低成本 31%;AGoT 无训练成本 | ⭐⭐⭐⭐ | +| **开源生态** | Qwen2.5-32B, Distill-Qwen-32B, LLaMA-3-70B 均可用于移植推广 | ⭐⭐⭐⭐⭐ | + +### 风险分析 + +| 风险 | 概率 | 影响 | 缓解措施 | +|------|------|------|---------| +| 32B 模型对图提示的遵循度不如 GPT-4 | 中 | 高 | 增加 few-shot 示例,设计更强的 template | +| AGoT 计算开销过大 | 低 | 中 | 限制 `lmax/dmax/nmax` 参数 | +| SFT 效果不显著 | 中 | 中 | 使用 s1-v1.1 已验证数据集作为兜底 | +| 图属性因果方向不成立 | 低 | 高 | 消融实验直接验证 | + +--- + +## 三、综合结论 + +**可行。** 三条技术路线均有望在 32B 模型上实现显著的智能提升: + +1. **测试时增强(GoT/AGoT)** — 立即可用,无需模型修改, + 预期在数学推理上 +20%~46%,规划任务上 +50%~400% + +2. **图感知 SFT 训练** — 主动塑造推理图结构, + 已验证扩展推理图直径可同步提升性能 + +3. **内部图注意力(SaGoT)** — 最根本的方案, + 改变 Transformer 内部推理机制 + +三条路径互补,建议按**先易后难**的顺序推进: +Phase 2 (AGoT 测试时) → Phase 3 (SFT 训练) → SaGoT (内部机制)。 diff --git a/papers/2025.acl_SaGoT_Self_Attention_GoT.pdf b/papers/2025.acl_SaGoT_Self_Attention_GoT.pdf new file mode 100644 index 0000000..c0521c0 Binary files /dev/null and b/papers/2025.acl_SaGoT_Self_Attention_GoT.pdf differ diff --git a/papers/2308.09687_GoT_Solving_Elaborate_Problems.pdf b/papers/2308.09687_GoT_Solving_Elaborate_Problems.pdf new file mode 100644 index 0000000..9074a5d Binary files /dev/null and b/papers/2308.09687_GoT_Solving_Elaborate_Problems.pdf differ diff --git a/papers/2502.05078_AGoT_Adaptive_Graph_of_Thoughts.pdf b/papers/2502.05078_AGoT_Adaptive_Graph_of_Thoughts.pdf new file mode 100644 index 0000000..7c32e0e Binary files /dev/null and b/papers/2502.05078_AGoT_Adaptive_Graph_of_Thoughts.pdf differ diff --git a/papers/2502.13247_Grounding_LLM_Reasoning_KG.pdf b/papers/2502.13247_Grounding_LLM_Reasoning_KG.pdf new file mode 100644 index 0000000..fd1d66d Binary files /dev/null and b/papers/2502.13247_Grounding_LLM_Reasoning_KG.pdf differ diff --git a/papers/2506.05744_Topology_of_Reasoning.pdf b/papers/2506.05744_Topology_of_Reasoning.pdf new file mode 100644 index 0000000..fa7a8bd Binary files /dev/null and b/papers/2506.05744_Topology_of_Reasoning.pdf differ