修复NLA模型的奖励机制

来源未标注:Anthropic的NLA模型虽然能解释LLM内部状态,但解释中包含大量虚假细节。通过添加事实检查奖励,模型在保持重建能力的同时提高了解释的真实性,重构FVE从0.124提升至0.417。

修复NLA模型的奖励机制 | AI 趋势