arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 1990 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 1990 篇

2411.07180 2025-03-07 cs.CL cs.AI cs.LG 67%

Gumbel Counterfactual Generation From Language Models

Shauli Ravfogel, Anej Svete, Vésteinn Snæbjarnarson, Ryan Cotterell

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted in ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00750 2025-02-24 cs.CL cs.AI cs.LG 67%

Mitigating Tail Narrowing in LLM Self-Improvement via Socratic-Guided Sampling

Yiwen Ding, Zhiheng Xi, Wei He, Zhuoyuan Li, Yitao Zhai, Xiaowei Shi, Xunliang Cai, Tao Gui, Qi Zhang, Xuanjing Huang

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to NAACL 2025 Main Conference. Codes are publicly available at https://github.com/Yiwen-Ding/Guided-Self-Improvement

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.21236 2025-02-17 cs.LG cs.AI cs.CL 67%

Flaming-hot Initiation with Regular Execution Sampling for Large Language Models

Weizhe Chen, Zhicheng Zhang, Guanlin Liu, Renjie Zheng, Wenlei Shi, Chen Dun, Zheng Wu, Xing Jin, Lin Yan

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00663 2025-01-03 cs.LG cs.AI cs.CL 67%

Titans: Learning to Memorize at Test Time

Ali Behrouz, Peilin Zhong, Vahab Mirrokni

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01951 2024-12-05 cs.AI cs.CL cs.LG stat.ML 67%

Self-Improvement in Language Models: The Sharpening Mechanism

Audrey Huang, Adam Block, Dylan J. Foster, Dhruv Rohatgi, Cyril Zhang, Max Simchowitz, Jordan T. Ash, Akshay Krishnamurthy

专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.06590 2024-11-12 cs.LG cs.AI cs.CL 67%

CriticAL: Critic Automation with Language Models

Michael Y. Li, Vivek Vajipey, Noah D. Goodman, Emily B. Fox

专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.20974 2024-10-07 cs.CL cs.AI cs.LG 67%

SaySelf: Teaching LLMs to Express Confidence with Self-Reflective Rationales

Tianyang Xu, Shujin Wu, Shizhe Diao, Xiaoze Liu, Xingyao Wang, Yangyi Chen, Jing Gao

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments EMNLP 2024 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.02811 2024-10-07 cs.AI cs.CL cs.LG 67%

SAC-KG: Exploiting Large Language Models as Skilled Automatic Constructors for Domain Knowledge Graphs

Hanzhu Chen, Xu Shen, Qitan Lv, Jie Wang, Xiaoqi Ni, Jieping Ye

专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.AI、cs.LG

Comments ACL 2024 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.10938 2024-10-03 cs.LG cs.AI cs.CL stat.ML 67%

Observational Scaling Laws and the Predictability of Language Model Performance

Yangjun Ruan, Chris J. Maddison, Tatsunori Hashimoto

专题命中 测试时计算 :chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted at NeurIPS 2024 as a spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.18290 2024-07-31 cs.LG cs.AI cs.CL 67%

Direct Preference Optimization: Your Language Model is Secretly a Reward Model

Rafael Rafailov, Archit Sharma, Eric Mitchell, Stefano Ermon, Christopher D. Manning, Chelsea Finn

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.19668 2024-05-31 cs.CV 67%

AutoBreach: Universal and Adaptive Jailbreaking with Efficient Wordplay-Guided Optimization

Jiawei Chen, Xiao Yang, Zhengwei Fang, Yu Tian, Yinpeng Dong, Zhaoxia Yin, Hang Su

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract)

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.07927 2024-05-20 cs.CL cs.AI cs.LG 67%

Are self-explanations from Large Language Models faithful?

Andreas Madsen, Sarath Chandar, Siva Reddy

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments The 62nd Annual Meeting of the Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.08373 2024-05-15 cs.CL cs.AI cs.LG 67%

PromptMind Team at MEDIQA-CORR 2024: Improving Clinical Text Correction with Error Categorization and LLM Ensembles

Satya Kesav Gundabathula, Sriram R Kolar

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Paper accepted for oral presentation at Clinical NLP workshop, NAACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.02226 2024-04-23 cs.CL cs.AI cs.LG 67%

Think before you speak: Training Language Models With Pause Tokens

Sachin Goyal, Ziwei Ji, Ankit Singh Rawat, Aditya Krishna Menon, Sanjiv Kumar, Vaishnavh Nagarajan

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Published at ICLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.02935 2024-04-05 cs.CL cs.AI cs.LG 67%

KnowHalu: Hallucination Detection via Multi-Form Knowledge Based Factual Checking

Jiawei Zhang, Chejian Xu, Yu Gai, Freddy Lecue, Dawn Song, Bo Li

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.06272 2024-02-27 cs.CL cs.AI cs.LG 67%

Let Models Speak Ciphers: Multiagent Debate through Embeddings

Chau Pham, Boyi Liu, Yingxiang Yang, Zhengyu Chen, Tianyi Liu, Jianbo Yuan, Bryan A. Plummer, Zhaoran Wang, Hongxia Yang

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to ICLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.15393 2024-02-06 cs.LG cs.AI cs.CL 67%

DoGE: Domain Reweighting with Generalization Estimation

Simin Fan, Matteo Pagliardini, Martin Jaggi

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.03047 2023-12-05 cs.LG cs.AI cs.CL cs.CY 67%

Principle-Driven Self-Alignment of Language Models from Scratch with Minimal Human Supervision

Zhiqing Sun, Yikang Shen, Qinhong Zhou, Hongxin Zhang, Zhenfang Chen, David Cox, Yiming Yang, Chuang Gan

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted at NeurIPS 2023 (Spotlight). Project page: https://github.com/IBM/Dromedary

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.09299 2023-11-15 cs.CL cs.AI cs.LG 67%

Can Language Models Teach Weaker Agents? Teacher Explanations Improve Students via Personalization

Swarnadeep Saha, Peter Hase, Mohit Bansal

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments NeurIPS 2023 (23 pages, 12 figures). Our code is available at https://github.com/swarnaHub/ExplanationIntervention

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.14707 2023-10-16 cs.CL cs.AI cs.LG 67%

SciFix: Outperforming GPT3 on Scientific Factual Error Correction

Dhananjay Ashok, Atharva Kulkarni, Hai Pham, Barnabás Póczos

专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.AI、cs.LG

Comments To appear in proceedings of EMNLP2023 (findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.16183 2023-10-03 cs.LG cs.AI cs.CL 67%

Passive learning of active causal strategies in agents and language models

Andrew Kyle Lampinen, Stephanie C Y Chan, Ishita Dasgupta, Andrew J Nam, Jane X Wang

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Advances in Neural Information Processing Systems (NeurIPS 2023). 10 pages main text

详情

展开后加载摘要…

URL PDF HTML 收藏
2202.11705 2022-10-17 cs.CL cs.AI cs.LG 67%

COLD Decoding: Energy-based Constrained Text Generation with Langevin Dynamics

Lianhui Qin, Sean Welleck, Daniel Khashabi, Yejin Choi

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments NeurIPS 2022. code: https://github.com/qkaren/COLD_decoding

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17136 2026-07-21 cs.SE cs.AI cs.HC cs.LG 新提交 66%

Teach it to stop, not just to click

教它停止,而不仅仅是点击

Barada Sahu, Shivesh Pandey

机构 * Cabal AI Para AI

专题命中 测试时计算 :verifier(abstract,comments);分类 cs.AI、cs.LG

AI总结 研究智能体计算机使用强化学习中单次运行结果的误导性,通过验证器引导修复35B智能体,发现成功率受上游方差主导,修复能力分两层,框架级修复有条件,还发现自身过度断言,发布库用于k种子报告,首次进行多模态分段聚合策略内自蒸馏更新。

Comments 15 pages, 3 figures. Reliability protocol and library (cua_reliability), completion verifier, and leakage-free held-out plus bootstrap evaluation harness are open-source

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05542 2025-12-08 cs.LG cs.AI 66%

RoBoN: Routed Online Best-of-n for Test-Time Scaling with Multiple LLMs

RoBoN: 基于路由的在线最佳-n方法用于多LLM测试时间扩展

Jonathan Geuter, Gregor Kornhardt

机构 * Kempner Institute for the Study of Natural & Artificial Intelligence(自然与人工智能研究 institute)

专题命中 测试时计算 :reasoning(abstract,comments);分类 cs.AI、cs.LG

AI总结 RoBoN通过在线路由多LLM生成过程,提高测试时间扩展性能,无需额外训练,有效提升准确率。

Comments 20 pages, 3 figures. 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop: Foundations of Reasoning in Language Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12485 2026-08-18 cs.LG cs.AI 版本更新 62%

Speculative Rollback Correction for Quality-Diverse Web Agent Imitation

面向质量多样性的Web智能体模仿的推测性回滚修正

Longkun Hao, Hongyu Lin, Hao Li, Zhuowen Liu, Zhichao Yang, Haojie Hao, Dongshuo Huang, Haitao Yang, Hongyu Ge, Ming jie Xie, Yanjun Wu, Zi Hao Yin, Yan Bai, Yihang Lou

机构 * Beihang University(北京航空航天大学) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) The Hong Kong University of Science and Technology(香港科技大学) Northwestern Polytechnical University(西北工业大学) Tsinghua University(清华大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Peking University(北京大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI、cs.LG

AI总结 提出推测性回滚修正(SRC)框架,通过固定视野分支审查和回滚机制,在减少教师查询的同时保持轨迹多样性,在WebArena-Infinity上收集了977条通过验证的轨迹和9183个下一步动作示例。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05466 2026-08-14 cs.AI cs.LG 版本更新 62%

Recursive Synthesis for Long-Horizon Terminal Tasks

长视界终端任务的递归合成

Zhongzhi Li, Yucheng Shi, Zongxia Li, Ruhan Wang, Anhao Li, Zixun Huang, Junyao Yang, Lei Ke, Ninghao Liu, Haitao Mi, Leowei Liang

机构 * Tencent HY LLM Frontier(腾讯HY大模型前沿团队) University of Georgia(佐治亚大学) University of Maryland, College Park(马里兰大学帕克分校) University of Pennsylvania(宾夕法尼亚大学) University of Minnesota, Twin Cities(明尼苏达大学双城分校) Indiana University(印第安纳大学) National University of Singapore(新加坡国立大学) Hong Kong Polytechnic University(香港理工大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI、cs.LG

AI总结 本文提出RST递归合成框架,低成本规模化生成3.7万余个长视界终端任务,经微调或PPO优化后,多款Qwen模型在多个终端基准任务上性能显著提升,且递归过程无明显上限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05678 2026-08-14 cs.CL cs.AI 版本更新 62%

Gradual Code-Switching as Inference-Time Cross-Lingual Representational Alignment for LLMs

渐进式代码切换作为大语言模型推理时的跨语言表征对齐

Haneul Yoo, Jiho Jin, Kyunghyun Cho, Alice Oh

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 针对大语言模型跨语言性能不均衡问题,提出推理时的代码切换上下文学习机制,经多模型、多语言、多数据集验证,可显著提升目标及未见语言任务性能,尤其在低资源场景表现突出。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11829 2026-08-13 cs.LG cs.CL 新提交 62%

Towards Understanding On-Policy Distillation through the Lens of Test-Time Scaling

从测试时缩放的视角理解在线策略蒸馏

Xinmu Ge, Zizhuo Zhang, Yu Huang, Jianing Zhu, Lin Yuan, Wanli Gu, Weichang Wu, Weiran Huang, Xiaolu Zhang, Bo Han, Jun Zhou, Jiangchao Yao

机构 * Hong Kong Baptist University(香港浸会大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Ant Group(蚂蚁集团)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 该研究从测试时缩放视角分析OPD,发现其主要提升采样效率而非扩展推理能力边界,属于“虚假蒸馏”。

Comments 15 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11420 2026-08-13 cs.AI cs.CL 新提交 62%

Social Chain of Thought: A Multi-Agent Architecture Grounded in Medical Differential Diagnosis Methodology

社会思维链:一种基于医学鉴别诊断方法论的多智能体架构

Del Coburn, Scott Sanner, Dan Silver

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于医学鉴别诊断方法论的多智能体架构SCoT,通过多轮专家协作提升复杂病例诊断召回率,其优势无法通过单一推理实现。

Comments 14 pages, 9 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08837 2026-08-13 cs.LG cs.AI 版本更新 62%

Prompt-Driven Exploration

提示驱动的探索

Sunshine Jiang, John Marangola, David Zhang, Raghuram Kowdeed, Ruiyang Luo, Nitish Dashora, Richard Li, Pulkit Agrawal, Zhang-Wei Hong

机构 * Massachusetts Institute of Technology(麻省理工学院) MIT-IBM Computing Research Lab(麻省理工学院-IBM计算研究实验室) Improbable AI Lab(英普罗巴布尔人工智能实验室)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究针对强化学习中探索难的问题,提出提示驱动的探索策略(PDE),利用视觉-语言模型对轨迹视频推理,从弱策略轨迹中优化提示,实现后验采样,能让强化学习从零奖励起步学习成功策略并提升样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏