AI WEEKLY VOL. 2026-W22
周报 2026-05-25 ~ 2026-05-31
2026-05-25 至 2026-05-31 AI 技术周报
22 条信息 约 4 分钟
论文精选
DelTA,基于可验证奖励的强化学习判别式 Token 信用分配
社区热度 192 · 查看论文
论文从判别器视角分析可验证奖励强化学习(RLVR)的更新过程,解释响应级奖励如何转化为 Token 级概率变化。其信用分配方法可用于分析 RLHF 和 RLAIF 的训练稳定性与效率。
SkillOpt,自进化 Agent 技能的执行策略
社区热度 159 · 查看论文
现有 Agent 技能多由人工编写或一次性生成,缺少稳定的反馈改进机制。论文把技能视为冻结 Agent 的外部状态,并用优化策略持续更新技能。
LocateAnything,通过并行框解码实现快速、高质量的视觉语言定位
社区热度 93 · 查看论文
π-Bench,评估长周期工作流中的主动式个人助理 Agent
社区热度 91 · 查看论文
该基准关注 Agent 处理模糊需求和长周期任务时的主动性,评估它能否主动澄清问题并识别约束。
Lens,重新思考基础文生图模型的训练效率
社区热度 90 · 查看论文
Lens 是一个 3.8B 参数的文生图模型。论文报告称,它在部分指标上达到或超过 6B 参数模型,训练算力约为后者的 19.3%。