Zhongzhu (Charlie) Zhou
Home
Research
Publication
Experience
Recent News
Blog
CV
↗
Tag
#
Reasoning
60 posts tagged with this label. Back to
all tags
or the
main feed
.
2026
08-17
EN
AgentRewind: Giving Long-Horizon LLM Agents an Undo Button That Actually Undoes Things
08-17
中
AgentRewind 阅读笔记:给长程 LLM Agent 装一个真正能撤销的悔棋键
08-11
EN
CVPO: Curriculum-Guided Value-Variance Policy Optimization for LLM Reasoning
08-11
中
CVPO 阅读笔记:用价值方差驱动的课程式策略优化
08-10
EN
GRAFT: Global Optimization and Inference-Time Region Grafting for Agentic Workflows
08-10
中
阅读笔记:GRAFT——给智能体工作流做「全局定骨架、局部动手术」的推理时嫁接
08-03
EN
BLADE: Boundary-Expanded and Layer-Adaptive Dynamic Exit for Efficient LLM Reasoning
08-03
中
BLADE 阅读笔记:把「早退」这件事从自我怀疑词扩展到普通句子边界
07-27
EN
The Regression Tax: Why Adding Skills to an LLM Agent Also Breaks Tasks It Used to Solve
07-27
中
Regression Tax(回归税):给 LLM Agent 加 Skill 为什么既能帮忙又能拆台
07-25
EN
When Does Adding More Agents Actually Help? An Information-Bottleneck Answer
07-25
中
多智能体到底什么时候才有用?一个信息瓶颈视角的答案
07-20
EN
SEED: When Hindsight Becomes a Training Signal, Not Just a Better Prompt
07-20
中
SEED 阅读笔记:当「事后诸葛亮」变成训练信号,而不只是更好的提示词
07-14
EN
RIPO: Why PPO's Ratio Clipping Is the Wrong Metric, and What Riemannian Geometry Fixes
07-14
中
RIPO 阅读笔记:PPO 的比率裁剪为什么量错了尺度,黎曼几何给出的修正
07-13
EN
Long-Horizon-Terminal-Bench: Dense Reward Grading Exposes Agent Long-Horizon Execution Limits
07-13
中
Long-Horizon-Terminal-Bench 阅读笔记:密集奖励评估揭露 Agent 长程执行瓶颈
07-06
EN
The Mirage of Optimizing Training Policies: Monotonic Inference Policy Improvement for LLM RL
07-06
中
训练策略的幻觉:为什么LLM强化学习的真正目标是推理策略单调改进
06-30
EN
DAPO: An Open-Source LLM Reinforcement Learning System at Scale — Technical Review
06-30
中
DAPO:大规模 LLM 强化学习系统阅读笔记
06-29
EN
ACTS: Steering How LLMs Reason, Not Just How Long
06-29
中
ACTS:用强化学习训练的控制器,让 LLM 推理更聪明而不只是更短
06-23
EN
Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback
06-23
中
Critique-GRPO:用自然语言批评反馈突破强化学习训练瓶颈
06-22
EN
MRAgent: Why Memory Should Be Reconstructed, Not Retrieved
06-22
中
MRAgent:记忆应该被重建,而不是被检索
06-19
EN
LASER: How Throwing Away 99% of a Weight Matrix Can Make LLMs Smarter
06-19
中
LASER:丢掉 99% 的矩阵秩,LLM 推理准确率反而提高了 27%
06-09
EN
VAPO: Value-Augmented Proximal Policy Optimization for Long-CoT Reasoning
06-09
中
VAPO:面向长链推理的价值增强近端策略优化
06-08
EN
ExpWeaver: How LLM Agents Learn from Past Experience in Latent Space
06-08
中
ExpWeaver:LLM 智能体如何在隐空间中从经验中学习
06-06
EN
DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
06-06
中
DeepSeek-R1:用强化学习激发大语言模型的推理能力
05-31
EN
Group Sequence Policy Optimization: A Sequence-Level RL Algorithm for Training Large Language Models
05-31
中
Group Sequence Policy Optimization:序列级重要性采样修正 GRPO 的 RL 训练方法
05-25
EN
CodeAct: Executable Code Actions Elicit Better LLM Agents
05-25
中
CodeAct:用可执行代码驱动更强的 LLM Agent
05-23
EN
DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
05-23
中
DeepSeek-R1:用强化学习激发大语言模型的推理能力
05-18
EN
Why Single-Agent LLMs Beat Multi-Agent Systems on Multi-Hop Reasoning — A Budget-Controlled Story
05-18
中
思考预算锁死之后,单 Agent 为什么打过多 Agent —— 阅读笔记
05-15
EN
Zero Sum SVD: A Global, Loss-Aware Rank Budget for LLM Compression
05-15
中
Zero Sum SVD:用「损失零和」做全局奇异值预算分配的 LLM 压缩方法
05-12
EN
DAPO: An Open-Source LLM Reinforcement Learning System at Scale
05-12
中
DAPO:大规模开源 LLM 强化学习系统
05-01
EN
Low-Rank Optimization Trajectories for LLM RLVR Acceleration: A Technical Review of NExt
04-27
EN
Agentic World Modeling: Foundations, Capabilities, Laws, and Beyond — Technical Review
04-22
EN
SAGE: Training-Free Semantic Evidence Composition for Edge-Cloud Inference Under Hard Uplink Budgets
04-19
EN
SpecGuard: Verification-Aware Speculative Decoding for Efficient Multi-Step Reasoning
04-19
中
SpecGuard:用于多步推理的验证感知推测解码
04-13
EN
Toolformer: Language Models Can Teach Themselves to Use Tools — Deep Technical Review
04-13
中
Toolformer:让语言模型自己学会“什么时候调用工具”——深度阅读笔记
04-11
EN
Language Agent Tree Search (LATS): Unifying Reasoning, Acting, and Planning in Language Models — Deep Technical Review
04-11
中
LATS(Language Agent Tree Search):把推理、行动、规划统一到同一个语言模型代理框架里 — 深度阅读笔记
03-30
EN
Chain-of-Thought Prompting Elicits Reasoning in LLMs — In-Depth Technical Review
02-20
EN
DeepSeekMath: How 120B Tokens of Math Data and GRPO Rival GPT-4 on Competition Problems
02-16
EN
Tree of Thoughts: Deliberate Problem Solving with Large Language Models — Technical Review