aa8ba6a6d7
graph-enhanced 32B LLM reasoning
131 lines
5.2 KiB
Markdown
131 lines
5.2 KiB
Markdown
# 可行性评估报告
|
||
|
||
> 评估目标:验证"思维图或其他图论应用,可以让32b大小的模型有极大的智能提升"
|
||
|
||
**评估结论:✅ 可行,证据充分**
|
||
|
||
评估日期:2026-07-03
|
||
评估者:Claude Code
|
||
|
||
---
|
||
|
||
## 一、核心论文分析
|
||
|
||
### 1.1 Topology of Reasoning (NeurIPS 2025)
|
||
|
||
**论文**: *"Topology of Reasoning: Understanding Large Reasoning Models through Reasoning Graph Properties"*
|
||
(Minegishi et al., University of Tokyo & Google DeepMind)
|
||
|
||
这是最直接相关的论文,系统分析了不同规模模型(1.5B/7B/14B/32B)的推理图属性。
|
||
|
||
**关键发现**:
|
||
|
||
| 属性 | 32B 推理模型 vs 基础模型 | 与准确率的关系 |
|
||
|------|------------------------|---------------|
|
||
| **循环性 (Cyclicity)** | ~5次循环/样本 (基础模型 ~0) | 正相关。14B 达 100% 循环检测率,32B 循环数最多 |
|
||
| **图直径 (Diameter)** | 32B 模型最大 | **强正相关**。直径随模型规模递增,32B 最大直径对应最高 AIME 准确率 |
|
||
| **小世界指数 (Small-World)** | ~6 倍于基础模型 | 高局部聚类 + 短全局路径 → 推理效率更高 |
|
||
|
||
**核心贡献**:
|
||
- 证明 SFT 优质数据可以**系统性扩展推理图直径**,同时提升性能
|
||
- 提供可操作的 SFT 数据集设计指南
|
||
- 论文代码开源: https://github.com/gouki510/Topology_of_Reasoning
|
||
|
||
### 1.2 Graph of Thoughts: Solving Elaborate Problems with LLMs (AAAI 2024)
|
||
|
||
**论文**: Besta et al., ETH Zurich
|
||
|
||
**核心方法**:
|
||
- 将 LLM 推理过程建模为**任意有向图** (顶点 = 思考单元,边 = 依赖关系)
|
||
- 支持三种图变换: 生成 (Generation)、聚合 (Aggregation)、精炼 (Refinement)
|
||
- 图操作规范 (GoO) 可描述 CoT / CoT-SC / ToT / GoT 等所有提示方案
|
||
|
||
**关键结果**:
|
||
- 排序任务: 质量比 ToT 提升 **62%**,成本降低 **>31%**
|
||
- 集合操作: GoT 在所有实例上优于 IO / CoT / ToT
|
||
- 关键词计数: 4-passage 分割方案最优,错误率最低
|
||
- 使用模型: GPT-3.5 / GPT-4 / Llama-2
|
||
|
||
**对 32B 的启示**: GoT 是纯提示框架,不修改模型参数,可直接应用于任何 32B 模型。
|
||
|
||
### 1.3 Adaptive Graph of Thoughts (AGoT, 2025)
|
||
|
||
**论文**: Pandey et al., Agnostiq Inc.
|
||
|
||
**核心创新**:
|
||
- 动态 DAG 结构,在测试时递归分解复杂问题
|
||
- LLM 驱动的复杂度检查,仅对复杂节点递归展开
|
||
- 自终止机制,减少不必要的分支
|
||
- 统一了 Chain / Tree / Graph 三种范式的优势
|
||
|
||
**关键结果** (使用 gpt-4o-mini):
|
||
- GPQA 科学推理: **+46.2%** 提升
|
||
- Game of 24: **+400%** (从 10% → 50%)
|
||
- 检索任务: 全部优于 IO / CoT / AIoT
|
||
- 无需模型修改,纯测试时增强
|
||
- 效果与计算密集型 RL 方法可比
|
||
|
||
**对 32B 的启示**: AGoT 的递归分解设计特别适合数学推理和规划任务,
|
||
这些正是 32B 模型的强项领域。动态扩展特性避免了不必要的计算浪费。
|
||
|
||
### 1.4 SaGoT: Self-attention-based Graph-of-Thought (ACL 2025)
|
||
|
||
**论文**: Bai et al., 中国移动九天团队
|
||
|
||
**核心创新**:
|
||
- 修改 Transformer 内部自注意力机制实现图结构推理
|
||
- 使用图结构自注意力生成推理步骤
|
||
- **无需额外训练**,可无缝集成到预训练 LLM 中
|
||
- 提供内在可解释性
|
||
|
||
**对 32B 的启示**: 这是最深入的方案——不依赖外部提示工程,
|
||
而是改变模型内部的推理机制。如果成功,可能带来更根本的智能提升。
|
||
|
||
### 1.5 Grounding LLM Reasoning with Knowledge Graphs (2025)
|
||
|
||
**核心发现**:
|
||
- 在知识图谱数据上评估 CoT / ToT / GoT 策略
|
||
- 相比 CoT 基线在 GRBench 上 **+26.5%**
|
||
- 展示图结构提示在不同基础模型上的通用性
|
||
|
||
---
|
||
|
||
## 二、可行性评估矩阵
|
||
|
||
### 优势分析
|
||
|
||
| 维度 | 评估 | 证据强度 |
|
||
|------|------|---------|
|
||
| **理论基础** | 推理图属性(循环/直径/小世界)与准确率强相关 | ⭐⭐⭐⭐⭐ |
|
||
| **方法成熟度** | GoT/AGoT/SaGoT 三种方法均已发表 | ⭐⭐⭐⭐ |
|
||
| **32B 直接证据** | Topology of Reasoning 论文直接研究 32B 模型 | ⭐⭐⭐⭐⭐ |
|
||
| **成本可控** | GoT 相比 ToT 降低成本 31%;AGoT 无训练成本 | ⭐⭐⭐⭐ |
|
||
| **开源生态** | Qwen2.5-32B, Distill-Qwen-32B, LLaMA-3-70B 均可用于移植推广 | ⭐⭐⭐⭐⭐ |
|
||
|
||
### 风险分析
|
||
|
||
| 风险 | 概率 | 影响 | 缓解措施 |
|
||
|------|------|------|---------|
|
||
| 32B 模型对图提示的遵循度不如 GPT-4 | 中 | 高 | 增加 few-shot 示例,设计更强的 template |
|
||
| AGoT 计算开销过大 | 低 | 中 | 限制 `lmax/dmax/nmax` 参数 |
|
||
| SFT 效果不显著 | 中 | 中 | 使用 s1-v1.1 已验证数据集作为兜底 |
|
||
| 图属性因果方向不成立 | 低 | 高 | 消融实验直接验证 |
|
||
|
||
---
|
||
|
||
## 三、综合结论
|
||
|
||
**可行。** 三条技术路线均有望在 32B 模型上实现显著的智能提升:
|
||
|
||
1. **测试时增强(GoT/AGoT)** — 立即可用,无需模型修改,
|
||
预期在数学推理上 +20%~46%,规划任务上 +50%~400%
|
||
|
||
2. **图感知 SFT 训练** — 主动塑造推理图结构,
|
||
已验证扩展推理图直径可同步提升性能
|
||
|
||
3. **内部图注意力(SaGoT)** — 最根本的方案,
|
||
改变 Transformer 内部推理机制
|
||
|
||
三条路径互补,建议按**先易后难**的顺序推进:
|
||
Phase 2 (AGoT 测试时) → Phase 3 (SFT 训练) → SaGoT (内部机制)。
|