当下,大语言模型研究正从扩大训练时计算转向扩展测试时计算。扩展测试时计算的一种可行途径,是让大模型在推理阶段对其历史输出进行迭代式的验证与批判,通过多轮自我反思实现持续进化。基于可验证奖励的强化学习(Reinforcement Learning with Verifiable Rewards,RLVR)虽能提升单轮推理能力,但标准方法往往缺少自主改进机制;已有批评引导方法又常依赖更强教师模型、真实标签或其他外部反馈,难以在测试阶段持续发挥作用。
国际计算语言学年会(Annual Meeting of the Association for Computational Linguistics,ACL)是计算语言学与自然语言处理领域最具影响力的国际学术会议之一,被中国计算机学会(CCF)列为 A 类国际会议。第64届 ACL 于 2026 年 7 月 2 日至 7 日在美国圣迭戈举行。