1. 围绕项目经历深挖(具体实现/难点/效果)。
  2. PPT/文档解析场景:现有链路有哪些可继续优化点(准确率、速度、鲁棒性)。
  3. Agent 工具调用不准/选错工具时:你会用哪些约束与修正策略?
  4. 为提升工具调用/整体表现:SFT、强化学习(RL)分别怎么切入?
  5. PPO 里为什么常见 Reward Model + Critic(价值函数)双组件?各自作用是什么?
  6. 若用 GRPO 提升 Function Call:奖励函数怎么设计(结果奖励 vs 过程奖励等)?
  7. Agent 记忆/Memory 机制如何设计:存什么、何时写入、何时读取、如何遗忘?