Gumbel Counterfactual Generation From Language Models
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Accepted in ICLR 2025
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Accepted in ICLR 2025
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Accepted to NAACL 2025 Main Conference. Codes are publicly available at https://github.com/Yiwen-Ding/Guided-Self-Improvement
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
Comments EMNLP 2024 Main
专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.AI、cs.LG
Comments ACL 2024 Main
专题命中 测试时计算 :chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Accepted at NeurIPS 2024 as a spotlight
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract)
Comments Under review
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
Comments The 62nd Annual Meeting of the Association for Computational Linguistics
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Paper accepted for oral presentation at Clinical NLP workshop, NAACL 2024
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Published at ICLR 2024
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Accepted to ICLR 2024
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Accepted at NeurIPS 2023 (Spotlight). Project page: https://github.com/IBM/Dromedary
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
Comments NeurIPS 2023 (23 pages, 12 figures). Our code is available at https://github.com/swarnaHub/ExplanationIntervention
专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.AI、cs.LG
Comments To appear in proceedings of EMNLP2023 (findings)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Advances in Neural Information Processing Systems (NeurIPS 2023). 10 pages main text
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
Comments NeurIPS 2022. code: https://github.com/qkaren/COLD_decoding
教它停止,而不仅仅是点击
机构 * Cabal AI ; Para AI
专题命中 测试时计算 :verifier(abstract,comments);分类 cs.AI、cs.LG
AI总结 研究智能体计算机使用强化学习中单次运行结果的误导性,通过验证器引导修复35B智能体,发现成功率受上游方差主导,修复能力分两层,框架级修复有条件,还发现自身过度断言,发布库用于k种子报告,首次进行多模态分段聚合策略内自蒸馏更新。
Comments 15 pages, 3 figures. Reliability protocol and library (cua_reliability), completion verifier, and leakage-free held-out plus bootstrap evaluation harness are open-source
RoBoN: 基于路由的在线最佳-n方法用于多LLM测试时间扩展
机构 * Kempner Institute for the Study of Natural & Artificial Intelligence(自然与人工智能研究 institute)
专题命中 测试时计算 :reasoning(abstract,comments);分类 cs.AI、cs.LG
AI总结 RoBoN通过在线路由多LLM生成过程,提高测试时间扩展性能,无需额外训练,有效提升准确率。
Comments 20 pages, 3 figures. 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop: Foundations of Reasoning in Language Models
面向质量多样性的Web智能体模仿的推测性回滚修正
机构 * Beihang University(北京航空航天大学) ; Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) ; The Hong Kong University of Science and Technology(香港科技大学) ; Northwestern Polytechnical University(西北工业大学) ; Tsinghua University(清华大学) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Peking University(北京大学)
专题命中 测试时计算 :verifier(abstract);分类 cs.AI、cs.LG
AI总结 提出推测性回滚修正(SRC)框架,通过固定视野分支审查和回滚机制,在减少教师查询的同时保持轨迹多样性,在WebArena-Infinity上收集了977条通过验证的轨迹和9183个下一步动作示例。
长视界终端任务的递归合成
机构 * Tencent HY LLM Frontier(腾讯HY大模型前沿团队) ; University of Georgia(佐治亚大学) ; University of Maryland, College Park(马里兰大学帕克分校) ; University of Pennsylvania(宾夕法尼亚大学) ; University of Minnesota, Twin Cities(明尼苏达大学双城分校) ; Indiana University(印第安纳大学) ; National University of Singapore(新加坡国立大学) ; Hong Kong Polytechnic University(香港理工大学)
专题命中 测试时计算 :verifier(abstract);分类 cs.AI、cs.LG
AI总结 本文提出RST递归合成框架,低成本规模化生成3.7万余个长视界终端任务,经微调或PPO优化后,多款Qwen模型在多个终端基准任务上性能显著提升,且递归过程无明显上限。
渐进式代码切换作为大语言模型推理时的跨语言表征对齐
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 针对大语言模型跨语言性能不均衡问题,提出推理时的代码切换上下文学习机制,经多模型、多语言、多数据集验证,可显著提升目标及未见语言任务性能,尤其在低资源场景表现突出。
Comments COLM 2026
从测试时缩放的视角理解在线策略蒸馏
机构 * Hong Kong Baptist University(香港浸会大学) ; University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Shanghai Jiao Tong University(上海交通大学) ; Shanghai Innovation Institute(上海创新研究院) ; Ant Group(蚂蚁集团)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 该研究从测试时缩放视角分析OPD,发现其主要提升采样效率而非扩展推理能力边界,属于“虚假蒸馏”。
Comments 15 pages, 8 figures
社会思维链:一种基于医学鉴别诊断方法论的多智能体架构
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文提出基于医学鉴别诊断方法论的多智能体架构SCoT,通过多轮专家协作提升复杂病例诊断召回率,其优势无法通过单一推理实现。
Comments 14 pages, 9 figures, 6 tables
提示驱动的探索
机构 * Massachusetts Institute of Technology(麻省理工学院) ; MIT-IBM Computing Research Lab(麻省理工学院-IBM计算研究实验室) ; Improbable AI Lab(英普罗巴布尔人工智能实验室)
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 研究针对强化学习中探索难的问题,提出提示驱动的探索策略(PDE),利用视觉-语言模型对轨迹视频推理,从弱策略轨迹中优化提示,实现后验采样,能让强化学习从零奖励起步学习成功策略并提升样本效率。