SWE-Proof: Can Language Models Resolve Real-World Issues with Machine-Checked Proofs?
本文提出Benchproofer,将实际代码任务转化为形式验证问题,以提高LLM生成代码的正确性。
0 citationsRead paper
本文提出Benchproofer,将实际代码任务转化为形式验证问题,以提高LLM生成代码的正确性。
本文提出ActObs方法,通过同时监督动作和观察令牌来改进强化学习初始化,从而提高代理在不同任务上的性能和探索能力。
为解决MoE语言模型参数量大问题,提出HOPE方法,通过考虑专家间合作来优化剪枝决策,优于现有方法。
本文提出DenseFace方法,通过密度感知的概率匹配减少预训练面部识别模型中的种族偏见,同时保持识别精度。
本文提出MInTRL方法,通过稀疏局部干预增强探索范围,同时保持学习轨迹的在策略性,以解决强化学习中探索与学习能力之间的平衡问题。
本文提出Benchproofer,将实际代码任务转化为形式验证问题,以提高LLM生成代码的正确性。
本文提出ActObs方法,通过同时监督动作和观察令牌来改进强化学习初始化,从而提高代理在不同任务上的性能和探索能力。
为解决MoE语言模型参数量大问题,提出HOPE方法,通过考虑专家间合作来优化剪枝决策,优于现有方法。
本文提出DenseFace方法,通过密度感知的概率匹配减少预训练面部识别模型中的种族偏见,同时保持识别精度。
本文提出MInTRL方法,通过稀疏局部干预增强探索范围,同时保持学习轨迹的在策略性,以解决强化学习中探索与学习能力之间的平衡问题。