逍遥云初 | 2026.04.04
2026年3-4月期间积累的 10 个 AI 前沿概念,每个概念一张卡片:问题→方案→数据→洞察。覆盖 Agent 架构、LLM 优化、AI 工程化、安全四大方向。
🚀 1. MTP(Multi-Token Prediction)
数据: Better & Faster Large Language Models via Multi-token Prediction (Facebook/Meta):MTP 训练的模型在代码生成任务上质量提升 12%,推理速度可提升 2-3 倍(配合 speculative decoding)
状态: ✅ 已写入 Notion — Multi-Token Prediction: LLM Inference Revolution
🧠 2. Agent 记忆遗忘框架
数据: arXiv:2604.02280 — Novel Memory Forgetting Techniques for Autonomous AI Agents:自适应遗忘比 LRU/FIFO 等策略在下游任务准确率上提升 15-30%
状态: ⏳ 已推送话题,待写 Notion 独立文章(已在 Agent 能力跃迁文章中引用)
📐 3. Context Engineering
数据: LangChain — Context Engineering for AI Agents:LangChain 团队提出的概念,已在 LangGraph 中实现为 Context 管理 API
状态: ⏳ 已推送话题,待写 Notion
🤝 4. Human-in-the-Loop Workflow
数据: Anthropic Claude Agent SDK — Human-in-the-Loop:Claude Agent SDK 内置了 human-in-the-loop 原语,支持 pause-for-approval 模式
状态: ⏳ 已推送话题,待写 Notion
🔀 5. Structured LLM Routing
数据: arXiv:2604.01235 — Structured LLM Routing:48 种部署配置的全因子实验,Structured Routing 比单一最优模型节省 40% 成本
状态: ⏳ 已推送话题,待写 Notion
🛠 6. Claude Agent SDK
数据: Anthropic Claude Agent SDK (2026.03 公测):支持 Python/TypeScript,内置 Human-in-the-Loop、Streaming、Tool Use 原语
状态: ✅ 已写入 Notion — Skill+MCP vs Agent CLI vs Agent SDK:技术选型深度分析
🤔 7. CoT2(元认知思维链)
数据: arXiv:CoT2-Meta — 元认知思维链:在数学推理任务上,budget-aware 的元认知控制比固定预算 CoT 效率提升 2-5 倍
状态: ⏳ 已推送话题,待写 Notion
📊 8. Agent Psychometrics(IRT 评估)
数据: arXiv:2604.00594 — Agent Psychometrics:用 IRT 可以预测未见过的 benchmark 和 agent 组合的表现,跨 benchmark 迁移预测准确率高
状态: ✅ 已写入 Notion — Agent Psychometrics: 用心理学方法拆解 Coding Agent 能力
✅ 9. Eval-Driven Development (EDD)
数据: Anthropic — How we build effective AI agents:Anthropic 内部大量使用 Eval,每个新模型发布前要过数百个 Eval。类比 TDD 的红-绿-重构
状态: ✅ 已写入 Notion — Test-Driven Prompt Engineering: Unit Tests for Prompts
⚠️ 10. Abstraction Paradox(抽象悖论)
数据: arXiv:2604.01487 — AgentSocialBench: Privacy Benchmarks for LLM-based Agents:AgentSocialBench benchmark 验证,脱敏指令反而增加泄露面。43 页详细实验
状态: ✅ 已写入 Notion — CORAL + Abstraction Paradox: Agent自主进化与隐私悖论
概念之间的关联图谱
- 推理优化线: MTP → TTC → CoT2 (从训练到推理到元认知)
- Agent 工程线: Context Engineering → Human-in-the-Loop → Claude Agent SDK → CORAL
- 评估方法线: Eval-Driven Development → Agent Psychometrics → IRT 框架
- 安全风险线: Abstraction Paradox → Agent 记忆遗忘 → 信息流控制
- 成本优化线: Structured LLM Routing → TTC → Agent Psychometrics (选模型/选推理策略/选scaffold)





