arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 5804 信号源:cs.CL, cs.AI, cs.LG

1. 其他推理 5804 篇

2603.29678 2026-04-02 cs.AI 70%

View-oriented Conversation Compiler for Agent Trace Analysis

面向视角的对话编译器用于代理轨迹分析

Lvmin Zhang, Maneesh Agrawala

机构 * Stanford University(斯坦福大学)

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出VCC编译器,将原始代理JSONL日志转换为结构化视角,提升轨迹分析质量,减少token消耗并提升模型性能。

Comments Code: https://github.com/lllyasviel/VCC

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18325 2026-03-20 cs.LG stat.ML 70%

Learning to Reason with Curriculum I: Provable Benefits of Autocurriculum

学习与课程学习:自课程学习的可证明收益

Nived Rajaraman, Audrey Huang, Miro Dudik, Robert Schapire, Dylan J. Foster, Akshay Krishnamurthy

机构 * Microsoft Research(微软研究院)

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.LG

AI总结 本文研究了自课程学习在提升语言模型推理能力方面的有效性,通过自适应数据选择技术,在监督微调和强化学习中分别减少了训练数据和计算成本。

Comments 39 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23184 2026-03-10 cs.CL 70%

PonderLM-2: Pretraining LLM with Latent Thoughts in Continuous Space

PonderLM-2: 在连续空间中通过潜在思想预训练语言模型

Boyi Zeng, He Li, Shixiang Song, Yixuan Wang, Zitong Wang, Ziwei He, Xinbing Wang, Zhouhan Lin

机构 * LUMIA Lab(LUMIA实验室) School of Artificial Intelligence(人工智能学院) Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院) Sun Yat-sen University(中山大学)

专题命中 其他推理 :chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 PonderLM-2通过在预训练过程中引入潜在思想的连续空间优化,提升了语言模型的生成能力与下游任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01250 2026-02-03 cs.CL 70%

GemDetox at TextDetox CLEF 2025: Enhancing a Massively Multilingual Model for Text Detoxification on Low-resource Languages

GemDetox在TextDetox CLEF 2025中的应用:增强大规模多语言模型以在低资源语言上进行文本去毒化

Trung Duc Anh Dang, Ferdinando Pio D'Elia

机构 * Centre for Language Technology, University of Copenhagen, Denmark(语言技术中心,哥本哈根大学,丹麦)

专题命中 其他推理 :chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 GemDetox在TextDetox CLEF 2025中通过参数高效微调和提示技术提升多语言文本去毒化性能,尤其在低资源语言上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09631 2026-01-26 cs.CL 70%

LLMs Got Rhythm? Hybrid Phonological Filtering for Greek Poetry Rhyme Detection and Generation

LLMs Got Rhythm? 希腊诗歌押韵检测与生成的混合语音过滤

Stergios Chatzikyriakidis, Anastasia Natsina

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本文提出混合语音学算法与LLMs结合,解决希腊诗歌押韵检测与生成问题,通过验证循环提升性能至73.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10058 2026-01-16 cs.LG 70%

Unlabeled Data Can Provably Enhance In-Context Learning of Transformers

未标记数据可以证明性地增强Transformer的上下文学习

Renpu Liu, Jing Yang

机构 * University of Virginia(弗吉尼亚大学)

专题命中 其他推理 :chain-of-thought(abstract);CoT(abstract);分类 cs.LG

AI总结 本文提出了一种增强ICL框架,通过结合标记和未标记数据,利用CoT提示使Transformer模拟EM算法,从而证明性地提升ICL性能。

Comments Published as a conference paper at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06416 2026-01-15 cs.AI cs.HC 70%

Advancing AI Negotiations: A Large-Scale Autonomous Negotiation Competition

推进人工智能谈判:大规模自主谈判竞赛

Michelle Vaccaro, Michael Caosun, Harang Ju, Sinan Aral, Jared R. Curhan

机构 * MIT Sloan School of Management(麻省理工学院斯隆管理学院) Johns Hopkins Carey Business School(约翰霍普金斯大学卡里商学院)

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文通过大规模自主谈判竞赛发现,温暖特质在AI谈判中表现优异,主导策略在价值争夺中有效,需建立新的AI谈判理论以优化代理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02983 2026-01-07 cs.SD cs.AI 70%

Interpretable All-Type Audio Deepfake Detection with Audio LLMs via Frequency-Time Reinforcement Learning

通过频率-时间强化学习实现可解释的多类型音频深度伪造检测

Yuankun Xie, Xiaoxuan Guo, Jiayi Zhou, Tao Wang, Jian Liu, Ruibo Fu, Xiaopeng Wang, Haonan Cheng, Long Ye

机构 * Communication University of China(中国通信大学) Machine Intelligence, Ant Group(蚂蚁集团机器智能部) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 其他推理 :chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 本文提出FT-GRPO方法,通过频率-时间强化学习实现多类型音频深度伪造检测的可解释性与高性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00923 2026-01-06 cs.AI 70%

Context Collapse: In-Context Learning and Model Collapse

上下文崩溃:上下文学习与模型崩溃

Josef Ott

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本研究探讨了大型语言模型中上下文学习与模型崩溃现象,通过数学分析揭示了上下文长度与模型稳定性之间的关系。

Comments Master's thesis

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10684 2026-01-05 cs.CL cs.CY 70%

SpiderGen: Towards Procedure Generation For Carbon Life Cycle Assessments with Generative AI

SpiderGen:面向碳生命周期评估的流程生成方法

Anupama Sitaraman, Bharathan Balaji, Yuvraj Agarwal

机构 * Amazon(亚马逊)

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 SpiderGen利用生成式AI生成碳生命周期评估的流程图,准确率达65%,显著降低评估成本和人力投入。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24347 2025-12-24 cs.CL eess.AS 70%

Fewer Hallucinations, More Verification: A Three-Stage LLM-Based Framework for ASR Error Correction

更少的幻觉,更多的验证:一种基于LLM的三阶段框架用于语音识别错误纠正

Yangui Fang, Baixu Chen, Jing Peng, Xu Li, Yu Xi, Chengwei Zhang, Guohui Zhong

机构 * Huazhong University of Science and Technology, School of Electronic Information and Communications(华中科技大学电子信息与通信学院) MoE Key Lab of Artificial Intelligence, AI Institute, X-LANCE Lab, Shanghai Jiao Tong University, Shanghai, China(人工智能联合实验室、AI研究院、X-LANCE实验室、上海交通大学) AISpeech Ltd, Suzhou, China(上海苏州AISpeech有限公司)

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本文提出一种基于LLM的三阶段框架,用于减少语音识别错误纠正中的幻觉问题,通过预检测、链式思维修正和推理验证提高纠正准确性。

Comments This paper has been ACCEPTED for publication in ASRU

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25510 2025-12-23 cs.LG cs.AR 70%

EEsizer: LLM-Based AI Agent for Sizing of Analog and Mixed Signal Circuit

EEsizer: 基于LLM的模拟和混合信号电路尺寸设计AI代理

Chang Liu, Danial Chitnis

机构 * The University of Edinburgh(爱丁堡大学) The School of Engineering(工程学院) Institute for Integrated Micro and Nano Systems(集成微纳系统研究所)

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.LG

AI总结 EEsizer是一种基于LLM的AI代理,通过整合大语言模型与电路仿真器和自定义数据分析功能,实现了模拟和混合信号电路尺寸设计的自动化,展示了在先进节点上的适应性和鲁棒性。

Journal ref IEEE Transactions on Circuits and Systems I: Regular Papers, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14064 2025-12-17 cs.CL 70%

What Affects the Effective Depth of Large Language Models?

影响大语言模型有效深度的因素是什么?

Yi Hu, Cai Zhou, Muhan Zhang

机构 * Institute for Artificial Intelligence, Peking University(人工智能研究院,北京大学) Department of Computer Science, Massachusetts Institute of Technology(计算机科学系,麻省理工学院)

专题命中 其他推理 :reasoning(abstract);CoT(abstract);分类 cs.CL

AI总结 研究发现大语言模型的有效深度受模型规模、训练类型和任务难度影响,且有效深度比例稳定,提示需提升层利用率、模型剪枝和提前退出技术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03276 2025-12-04 cs.LG 70%

Too Late to Recall: Explaining the Two-Hop Problem in Multimodal Knowledge Retrieval

太迟回忆:多模态知识检索中双跳问题的解释

Constantin Venhoff, Ashkan Khakzar, Sonia Joseph, Philip Torr, Neel Nanda

机构 * University of Oxford(牛津大学) McGill University(麦吉尔大学) Meta MATS

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.LG

AI总结 本文研究了多模态知识检索中双跳问题的影响,发现VLMs在处理视觉输入时过晚解决实体表示导致事实回忆性能下降,并提出通过修补和提示方法恢复性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02361 2025-12-03 cs.CV cs.AI 70%

VACoT: Rethinking Visual Data Augmentation with VLMs

VACoT:重新思考视觉数据增强与VLMs

Zhengzhuo Xu, Chong Sun, SiNan Du, Chen Li, Jing Lyu, Chun Yuan

机构 * Tsinghua University(清华大学) WeChat Vision, Tencent Inc(腾讯微信视觉部门)

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 VACoT通过在推理过程中动态调用图像增强,提升VLMs在挑战性和分布外输入中的鲁棒性,特别是在OCR对抗场景中,通过高效的智能强化学习减少训练开销并增强感知任务的推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22146 2025-12-01 cs.CL 70%

C$^2$DLM: Causal Concept-Guided Diffusion Large Language Models

C$^2$DLM: 基于因果概念的扩散大语言模型

Kairong Han, Nuanqiao Shan, Ziyu Zhao, Zijing Hu, Xinpeng Dong, Junjian Ye, Lujia Pan, Fei Wu, Kun Kuang

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Noah’s Ark Lab, Huawei Technologies(华为技术有限公司诺亚实验室)

专题命中 其他推理 :reasoning(abstract);CoT(abstract);分类 cs.CL

AI总结 C$^2$DLM通过引入因果概念引导机制,提升大语言模型在推理任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11087 2025-11-17 cs.CL 70%

Can LLMs Detect Their Own Hallucinations?

Sora Kadotani, Kosuke Nishida, Kyosuke Nishida

机构 * NTT Human Informatics Labs.(NTT人机信息实验室) NTT, Inc.(NTT公司)

专题命中 其他推理 :chain-of-thought(abstract);CoT(abstract);分类 cs.CL

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18425 2025-10-22 cs.AI 70%

Automated urban waterlogging assessment and early warning through a mixture of foundation models

Chenxu Zhang, Fuxiang Huang, Lei Zhang

专题命中 其他推理 :chain-of-thought(abstract);CoT(abstract);分类 cs.AI

Comments Submitted to Nature

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16856 2025-10-07 cs.CV cs.AI 70%

SIA: Enhancing Safety via Intent Awareness for Vision-Language Models

Youngjin Na, Sangheon Jeong, Youngwan Lee, Jian Lee, Dawoon Jeong, Youngman Kim

机构 * VLM Safety LAB, MODULABS(视觉语言模型安全实验室,MODULABS) ETRI(电子技术研究院) KAIST(韩国科学技术院)

专题命中 其他推理 :chain-of-thought(abstract);CoT(abstract);分类 cs.AI

Comments Accepted to Safe and Trustworthy Multimodal AI Systems(SafeMM-AI) Workshop at ICCV2025, Non-archival track

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19587 2025-09-25 cs.SE cs.AI 70%

Reverse Engineering User Stories from Code using Large Language Models

Mohamed Ouf, Haoyu Li, Michael Zhang, Mariam Guizani

机构 * Queen's University(皇后大学)

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17917 2025-09-23 cs.AI 70%

Orcust: Stepwise-Feedback Reinforcement Learning for GUI Agent

Junyu Lu, Songxin Zhang, Zejian Xie, Zhuoyang Song, Jiaxing Zhang

机构 * Lionrock AI Lab(狮岩人工智能实验室) China Merchants Research Institute of Advanced Technology(中国商人先进科技研究院)

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09727 2025-09-15 cs.CL cs.CE 70%

A Role-Aware Multi-Agent Framework for Financial Education Question Answering with LLMs

Andy Zhu, Yingjun Du

机构 * Rensselaer Polytechnic Institute(罗切斯特理工学院) University of Amsterdam(阿姆斯特丹大学)

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

Comments 8 pages, 6 figures, Underreview

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01379 2025-09-03 cs.CL 70%

WATCHED: A Web AI Agent Tool for Combating Hate Speech by Expanding Data

Paloma Piot, Diego Sánchez, Javier Parapar

机构 * IRLab, CITIC, Universidade da Coruña, Spain(IR实验室、CITIC、科鲁纳大学、西班牙)

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10444 2025-08-15 cs.CL 70%

DiFaR: Enhancing Multimodal Misinformation Detection with Diverse, Factual, and Relevant Rationales

Herun Wan, Jiaying Wu, Minnan Luo, Xiangzheng Kong, Zihan Ma, Zhi Zeng

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07127 2025-08-12 cs.LG q-bio.GN 70%

How Effectively Can Large Language Models Connect SNP Variants and ECG Phenotypes for Cardiovascular Risk Prediction?

Niranjana Arun Menon, Iqra Farooq, Yulong Li, Sara Ahmed, Yutong Xie, Muhammad Awais, Imran Razzak

机构 * University of New South Wales(新南威尔士大学) University of Surrey(萨里大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 其他推理 :reasoning(abstract);CoT(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19616 2025-07-29 cs.CL 70%

HITSZ's End-To-End Speech Translation Systems Combining Sequence-to-Sequence Auto Speech Recognition Model and Indic Large Language Model for IWSLT 2025 in Indic Track

Xuchen Wei, Yangxin Wu, Yaoyin Zhang, Henglyu Liu, Kehai Chen, Xuefeng Bai, Min Zhang

机构 * School of Computer Science and Technology, Harbin Institute of Technology, Shenzhen, China(计算机科学与技术学院,哈尔滨工业大学(深圳))

专题命中 其他推理 :chain-of-thought(abstract);CoT(abstract);分类 cs.CL

Comments 7 pages, 1 figure, submitted to IWSLT 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14256 2025-07-22 cs.SE cs.AI 70%

Impact of Code Context and Prompting Strategies on Automated Unit Test Generation with Modern General-Purpose Large Language Models

Jakub Walczak, Piotr Tomalak, Artur Laskowski

机构 * Lodz University of Technology(华沙理工大学) Comarch

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12761 2025-07-18 cs.CV cs.AI 70%

Think-Before-Draw: Decomposing Emotion Semantics & Fine-Grained Controllable Expressive Talking Head Generation

Hanlei Shi, Leyuan Qu, Yu Liu, Di Gao, Yuhua Zheng, Taihao Li

机构 * Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences(杭州高等研究院,中国科学院大学)

专题命中 其他推理 :chain-of-thought(abstract);CoT(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00742 2025-07-02 cs.LG 70%

Evaluating LLMs and Prompting Strategies for Automated Hardware Diagnosis from Textual User-Reports

Carlos Caminha, Maria de Lourdes M. Silva, Iago C. Chaves, Felipe T. Brito, Victor A. E. Farias, Javam C. Machado

机构 * Laboratório de Sistemas e Banco de Dados (LSBD) Departamento de Computação / Universidade Federal do Ceará (UFC) -- Fortaleza -- CE -- Brazil(系统与数据库实验室(LSBD)计算机系/北卡罗来纳州立大学(UFC)——福塔莱扎——CE——巴西)

专题命中 其他推理 :chain-of-thought(abstract);CoT(abstract);分类 cs.LG

Comments To be published in the Proceedings of the Brazilian Integrated Software and Hardware Seminar 2025 (SEMISH 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23014 2025-07-01 cs.SE cs.AI 70%

Generating Privacy Stories From Software Documentation

Wilder Baldwin, Shashank Chintakuntla, Shreyah Parajuli, Ali Pourghasemi, Ryan Shanz, Sepideh Ghanavati

机构 * School of Computing and Information Science(计算与信息科学学院) University of Maine(缅因大学)

专题命中 其他推理 :chain-of-thought(abstract);CoT(abstract);分类 cs.AI

Comments Accepted to RENext!'25 at the 33rd IEEE International Requirements Engineering 2025 conference

详情

展开后加载摘要…

URL PDF HTML 收藏