arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 2313 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 206 篇

2602.03141 2026-06-11 cs.CL 版本更新 79%

Short Chains, Deep Thoughts: Balancing Reasoning Efficiency and Intra-Segment Capability via Split-Merge Optimization

短链深思:通过拆分-合并优化平衡推理效率与段内能力

Runquan Gui, Jie Wang, Zhihai Wang, Chi Ma, Jianye Hao, Feng Wu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 提出CoSMo框架,通过拆分-合并算法动态优化推理链,结合段级预算的结构对齐强化学习,在保持准确率的同时显著减少冗余段,平均提升准确率3.3点并减少28.7%段使用。

Comments camera ready version upload

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16456 2026-06-11 cs.AI 版本更新 79%

GPO: Learning from Critical Steps to Improve LLM Reasoning

GPO:从关键步骤中学习以改进大语言模型推理

Jiahao Yu, Zelei Cheng, Xian Wu, Xinyu Xing

机构 * Department of Computer Science Northwestern University(计算机科学系西北大学) AI Foundations Capital One(人工智能基础资本 one) Meta AI

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 提出引导式关键优化(GPO)微调策略,通过识别推理轨迹中的关键步骤并优先学习,显著提升大语言模型的多步推理能力。

Comments 39th Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20845 2026-06-09 cs.AI cs.MA 版本更新 79%

MAR:Multi-Agent Reflexion Improves Reasoning Abilities in LLMs

MAR:多智能体反思提升大语言模型的推理能力

Onat Ozer, Yuchen Wang, Grace Wu, Daniel Dosti, Honghao Zhang, Vivi De La Rue

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 提出多智能体反思框架,通过多角色辩论生成多样化反思,解决单模型反思中的思维退化问题,在HotPot QA和HumanEval上分别达到47% EM和82.7%准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28742 2026-06-08 cs.AI 版本更新 79%

CORE: Contrastive Reflection Enables Rapid Improvements in Reasoning

CORE: 对比反思实现推理能力的快速提升

Linas Nasvytis, Simon Jerome Han, Ben Prystawski, Satchel Grant, Noah D. Goodman, Judith E. Fan

机构 * Stanford University(斯坦福大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 提出对比反思(CORE)非参数学习算法,通过对比成功与失败的推理轨迹生成自然语言洞察,在少量样本和 rollout 下实现比参数方法(GRPO)和非参数方法(GEPA、情景RAG、MemRL)更快的推理性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20144 2026-08-05 cs.DB 版本更新 78%

An Agentic Approach to Metadata Reasoning

元数据推理的代理方法

Jiani Zhang, Sercan O. Arik, Cosmin Arad, Fatma Ozcan, Alon Halevy

专题命中 复杂问题求解 :reasoning(title,abstract)

AI总结 本文提出元数据推理代理,通过检索候选表和自主咨询元数据,有效筛选数据源。在KramaBench和合成基准测试中,其在数据选择和避免低质量数据方面表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27706 2026-07-15 cs.MM 版本更新 78%

MAR3: Multi-Agent Recognition, Reasoning, and Reflection for Reference Audio-Visual Segmentation

MAR3:多智能体识别、推理与反思用于参考音频视觉分割

Yuan Zhao, Zhenqi Jia, Yongqiang Zhang

专题命中 复杂问题求解 :reasoning(title,abstract)

AI总结 本文提出MAR3框架,通过多智能体机制解决参考音频视觉分割中的表达难度识别、模态主导性分析及反思学习问题,提升分割精度。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22226 2026-07-14 cs.CV 版本更新 78%

Towards Temporal Compositional Reasoning in Long-Form Sports Videos

长期体育视频中的时间组成推理方法

Siyu Cao, Lu Zhang, Ruizhe Zeng, Zhi-yong Liu

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS)

专题命中 复杂问题求解 :reasoning(title,abstract)

AI总结 本文提出SportsTime基准和CoTR方法,通过时间接地证据组成提升体育视频长期推理能力,优于现有多模态大语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18242 2026-07-01 cs.CV 版本更新 78%

EgoVITA: Learning to Plan and Verify for Egocentric Video Reasoning

EgoVITA:学习规划与验证以实现自我中心视频推理

Yogesh Kulkarni, Pooyan Fazli

专题命中 复杂问题求解 :reasoning(title,abstract)

AI总结 提出EgoVITA框架,通过先规划自我中心动作序列再以第三方视角验证时空一致性的方法,提升自我中心视频推理的准确性。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01805 2026-06-18 cs.LG cs.AI cs.CL 版本更新 78%

Depth-Width tradeoffs in Algorithmic Reasoning of Graph Tasks with Transformers

图任务算法推理中Transformer的深度-宽度权衡

Gilad Yehudai, Clayton Sanford, Maya Bechler-Speicher, Orr Fischer, Ran Gilad-Bachrach, Amir Globerson

机构 * Courant Institute of Mathematical Sciences, New York University(纽约大学应用数学科学研究所) Google Research(谷歌研究) Meta AI Bar-Ilan University(巴伊兰大学) Department of Bio-Medical Engineering, Edmond J. Safra Center for Bioinformatics, Tel-Aviv University(生物医学工程系,埃德蒙·J·萨法中心,特拉维夫大学) Tel Aviv University(特拉维夫大学)

专题命中 复杂问题求解 :reasoning(title);分类 cs.CL、cs.AI、cs.LG

AI总结 研究Transformer在图算法任务中深度与宽度的权衡,发现线性宽度下常数深度足以解决许多图问题,而某些问题需要二次宽度,实验验证了宽模型在保持精度的同时训练和推理更快。

Comments Updated ISF grant number

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19748 2026-08-12 cs.AI cs.MA 版本更新 77%

Memory-Augmented Reinforcement Learning Agent for CAD Generation

具有记忆增强的强化学习代理的CAD生成

Yin Xiaolong, Liu Yu, Shen Jiahang, Lu Xingyu, Ni Jingzhe, Fan Fengxiao, Sang Fan

机构 * Zhejiang University(浙江大学)

专题命中 复杂问题求解 :reasoning(abstract);planning(abstract);self-correction(abstract);分类 cs.AI

AI总结 本文提出了一种记忆增强的强化学习框架,用于生成CAD模型,通过引入强化学习进行检索和策略优化,有效避免了检索陷阱,提高了复杂CAD模型生成的成功率和几何一致性。

Comments We are withdrawing this manuscript because we have identified issues in the current analysis that require substantial revision. Until these issues are resolved, we do not consider the present version suitable for citation

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07457 2026-07-21 cs.CL cs.AI 版本更新 76%

GRIP: In-Parameter Graph Reasoning through Fine-Tuning Large Language Models

GRIP:通过微调大语言模型进行参数内图推理

Jiarui Feng, Donghong Cai, Yixin Chen, Muhan Zhang

机构 * Washington University in Saint Louis(华盛顿大学圣路易斯分校) Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI)

专题命中 复杂问题求解 :reasoning(title);分类 cs.CL、cs.AI

AI总结 研究如何让大语言模型适应结构数据,提出GRIP方法,通过微调任务将图关系知识内化到模型参数,存储于轻量级LoRA模块,实验表明该方法在处理大图时优于基线,处理小图时以低推理成本达可比性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00996 2026-06-23 cs.CL cs.AI 版本更新 76%

DeALOG: Decentralized Multi-Agents Log-Mediated Reasoning Framework

DeALOG: 去中心化多智能体日志中介推理框架

Abhijit Chakraborty, Ashish Raj Shekhar, Shiven Agarwal, Vivek Gupta

机构 * Arizona State University(亚利桑那州立大学)

专题命中 复杂问题求解 :reasoning(title);分类 cs.CL、cs.AI

AI总结 提出去中心化多智能体框架DeALOG,通过共享自然语言日志实现多模态问答,各专业智能体协作检测和验证错误,无需中央控制,提升鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07306 2026-07-07 cs.RO cs.AI 版本更新 74%

BioProVLA-Agent: An Affordable, Protocol-Driven, Vision-Enhanced VLA-Enabled Embodied Multi-Agent System with Closed-Loop-Capable Reasoning for Biological Laboratory Manipulation

BioProVLA-Agent:一种经济实惠、基于协议、视觉增强的VLA启用的具身多智能体系统,具备闭环推理能力,用于生物实验室操作

Zhaohui Du, Zhe Wang, Dongzhan Zhou, Minting Pan, Hongmei Fei, Xiwen Cao, Ting Xiao, Qi Wang, Huanbo Jin, Jiaming Gu, Quan Lu, Zhe Liu

机构 * Key Laboratory of Smart Manufacturing in Energy Chemical Process Ministry of Education, East China University of Science and Technology, Shanghai, CN(能源化工过程智能制造教育部重点实验室,东华大学,上海,中国) Department of Computer Science and Engineering, East China University of Science and Technology, Shanghai, CN(东华大学计算机科学与工程系,上海,中国) Department of Laboratory Medicine, Ruijin Hospital, Shanghai Jiao Tong University School of Medicine, Shanghai, CN(复旦大学附属瑞金医院检验医学科,上海,中国) School of Information Science and Technology, Shihezi University, Shihezi, CN(石河子大学信息科学与技术学院,石河子,中国)

专题命中 复杂问题求解 :reasoning(title);分类 cs.AI

AI总结 本文提出BioProVLA-Agent,通过协议驱动和视觉增强,实现生物实验室操作中的具身多智能体系统,具备闭环推理能力,提升在湿实验室环境中的执行稳定性。

Comments 17 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03379 2026-06-23 cs.IR cs.AI 版本更新 74%

MemSifter: Offloading LLM Memory Retrieval via Outcome-Driven Proxy Reasoning

MemSifter: 通过结果驱动的代理推理卸载LLM记忆检索

Jiejun Tan, Zhicheng Dou, Liancheng Zhang, Yuyang Hu, Yiruo Cheng, Ji-Rong Wen

机构 * Gaoling School of Artificial Intelligence Renmin University of China Beijing China(中国人民大学朝阳学校人工智能 北京 中国) Renmin University of China(中国人民大学)

专题命中 复杂问题求解 :reasoning(title);分类 cs.AI

AI总结 提出MemSifter框架,用小模型代理替代主LLM进行记忆检索,通过强化学习优化检索结果,在8个基准上达到或超越现有方法。

Comments Code and datasets are available at https://github.com/plageon/MemSifter

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22122 2026-08-11 cs.RO cs.AI cs.CL cs.CV 版本更新 73%

REMAC: Self-Reflective and Self-Evolving Multi-Agent Collaboration for Long-Horizon Robot Manipulation

REMAC:用于长时程机器人操作的自反思与自进化多智能体协作框架

Puzhen Yuan, Angyuan Ma, Yunchao Yao, Huaxiu Yao, Masayoshi Tomizuka, Mingyu Ding

专题命中 复杂问题求解 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出REMAC自适应多智能体规划框架,通过自反思与自进化实现多机器人长时程任务规划,在RoboCasa基准测试中使任务平均成功率提升40%、执行效率提升52.7%。

Comments 24 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14113 2026-07-02 cs.CL cs.AI cs.CR 版本更新 73%

Toward Cybersecurity-Expert Small Language Models

面向网络安全专家的小型语言模型

Matan Levi, Daniel Ohayon, Ariel Blobstein, Ravid Sagi, Ian Molloy, Yair Allouche

机构 * IBM Research(IBM研究院)

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 针对网络安全领域缺乏高质量领域模型和训练数据的问题,提出CyberPal 2.0系列小型语言模型(4B-20B参数),通过SecKnowledge 2.0管道生成增强的思维链指令数据集,在多项网络安全基准测试中超越基线并匹配或超越前沿模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00482 2026-08-05 cs.CL 版本更新 70%

Know When to Stop: Segment-Level Credit Assignment for Reducing Overthinking

知止:用于减少过度思考的片段级信用分配

Chia-Hsuan Lee, Sihui Dai, Mingyang Zhou, Isha Slavin, Hsuan Su, Shi-Xiong Zhang, Sambit Sahu, William Campbell

机构 * Capital One(第一资本)

专题命中 复杂问题求解 :reasoning(abstract);self-correction(abstract);分类 cs.CL

AI总结 提出DASH方法,通过将推理轨迹中的最终答案候选与真实值比较,实现片段级信用分配,减少推理语言模型过度思考行为,在AIME25上准确率达50.8%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16379 2026-07-30 cs.IR cs.CL 版本更新 70%

LLMAR: A Tuning-Free Recommendation Framework for Sparse and Text-Rich Industrial Domains

LLMAR:一种适用于稀疏且文本丰富的工业领域的无调优推荐框架

Ryogo Hishikawa, Ichiro Kataoka, Shinya Yuda

机构 * Hitachi, Ltd. Research and Development Group(日立株式会社研发部门) Hitachi Power Solutions Co., Ltd.(日立电力解决方案公司)

专题命中 复杂问题求解 :reasoning(abstract);self-correction(abstract);分类 cs.CL

AI总结 LLMAR通过无调优框架整合大语言模型推理,捕捉用户潜在动机,解决工业领域数据稀疏问题,提升推荐准确率和效率。

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21013 2026-07-28 cs.AI cs.CV 版本更新 70%

EmoAgent-R1: Towards Multimodal Emotion Understanding with Reinforcement Learning-based Dynamic Agent Specialization

EmoAgent-R1:基于强化学习的动态智能体专业化实现多模态情感理解

Lihuang Fang, Yuchen Zou, kebing Jin, Jinghui Qin

机构 * Guangdong University of Technology(广东工业大学) Southern University of Science and Technology(南方科技大学) Xi’an Jiaotong University(西安交通大学) Guizhou Provincial Laboratory of Big Data, State Key Laboratory of Public Big Data, Guizhou University(贵州大学大数据省级重点实验室、公共大数据国家重点实验室)

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 研究针对现有多模态情感识别方法忽视情感源动态性和复杂性的问题,提出基于强化学习的动态智能体专业化框架EmoAgent-R1,采用冷启动策略和两步智能体工作流程训练,并用P-GRPO优化,实验证明其在情感推理性能和优化稳定性上更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01121 2026-07-07 cs.AI 版本更新 70%

HVR-Met: A Hypothesis-Verification-Replanning Agentic System for Extreme Weather Diagnosis

HVR-Met:一种用于极端天气诊断的假设验证-重新规划智能系统

Shuo Tang, Jiadong Zhang, Gengxian Zhou, Qizhao Jin, Qinxuan Wang, Yi Hu, Ning Hu, Hongchang Ren, Lingli He, Shiming Xiang, Jingtao Ding, Jian Xu, Jiaolan Fu, Cheng-Lin Liu

专题命中 复杂问题求解 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI

AI总结 针对深度学习天气预报难以应对极端天气诊断的挑战,提出HVR-Met多智能体气象诊断系统,其核心是假设验证-重新规划闭环机制,引入新基准测试,实验证明该系统在复杂诊断场景中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15141 2026-07-07 cs.LG 版本更新 70%

CLEANER: Self-Purified Trajectories Boost Agentic Reinforcement Learning

CLEANER:自我净化轨迹助力智能强化学习

Tianshi Xu, Yuteng Chen, Meng Li

机构 * Peking University(北京大学) NTU, Singapore(新加坡国立大学)

专题命中 复杂问题求解 :reasoning(abstract);self-correction(abstract);分类 cs.LG

AI总结 研究参数受限模型探索阶段因执行失败产生噪声轨迹影响策略优化的问题,提出CLEANER,利用模型自我纠错能力净化轨迹,其SAAR机制提升平均准确率,减少训练步骤。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03818 2026-06-23 cs.CL 版本更新 70%

Empirical Prompt Engineering for Construct Identification with Large Language Models

改善人机编码对齐:心理学构念识别中提示工程的实证评估

Kylie L. Anglin, Stephanie Milan, Brittney Hernandez, Claudia Ventura

机构 * Department of Educational Psychology, Neag School of Education, University of Connecticut(教育心理学系,教育学院,康涅狄格大学) Department of Psychological Sciences, College of Liberal Arts and Sciences, University of Connecticut(心理学系,文理学院,康涅狄格大学)

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本研究提出一个实证框架,通过提示工程优化大语言模型在心理学文本中识别构念的性能。实验评估五种提示策略,发现构念定义和任务框架最关键,结合代码簿引导和自动提示工程的少样本方法最接近专家判断。

Comments 22 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07223 2026-08-11 cs.CR cs.AI cs.CL cs.LG cs.SE 版本更新 67%

TraceSafe: A Systematic Assessment of LLM Guardrails on Multi-Step Tool-Calling Trajectories

TraceSafe: 对LLM在多步骤工具调用轨迹上的安全护栏的系统评估

Yen-Shan Chen, Sian-Yao Huang, Cheng-Lin Yang, Yun-Nung Chen

机构 * CyCraft AI Lab, Taiwan(CyCraft AI实验室(台湾)) National Taiwan University(国立台湾大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出TraceSafe-Bench,首个评估中间轨迹安全的综合基准,发现安全护栏效果更依赖结构数据能力而非语义安全对齐,通用模型在轨迹分析中表现更优,且准确性随执行步骤增加而提升。

Comments Accepted to Conference on Language Modeling (COLM) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02276 2026-08-10 cs.CL cs.AI cs.LG 版本更新 67%

Kimi K2.5: Visual Agentic Intelligence

Kimi K2.5:视觉代理智能

Kimi Team, Tongtong Bai, Yifan Bai, Yiping Bao, S. H. Cai, Yuan Cao, Ziwei Chai, Y. Charles, H. S. Che, Cheng Chen, Guanduo Chen, Huarong Chen, Jia Chen, Jianlong Chen, Jun Chen, Kefan Chen, Liang Chen, Ruijue Chen, Xinhao Chen, Yanru Chen, Yanxu Chen, Yicun Chen, Yimin Chen, Yingjiang Chen, Yuankun Chen, Yujie Chen, Yutian Chen, Zhirong Chen, Ziwei Chen, Dazhi Cheng, Yean Cheng, Minghan Chu, Jialei Cui, Jiaqi Deng, Muxi Diao, Hao Ding, Mengfan Dong, Mengnan Dong, Yuxin Dong, Yuhao Dong, Angang Du, Chenzhuang Du, Dikang Du, Lingxiao Du, Yulun Du, Yu Fan, Shengjun Fang, Qiulin Feng, Yichen Feng, Garimugai Fu, Kelin Fu, Hongcheng Gao, Tong Gao, Yuyao Ge, Shangyi Geng, Chengyang Gong, Xiaochen Gong, Zhuoma Gongque, Qizheng Gu, Xinran Gu, Yicheng Gu, Longyu Guan, Shuhao Guan, Yuanying Guo, Xiaoru Hao, Dailan He, Tianhong He, Weiran He, Wenyang He, Yibo He, Yunjia He, Chao Hong, Hao Hu, Jiaxi Hu, Yangyang Hu, Zhenxing Hu, Ke Huang, Ruiyuan Huang, Weixiao Huang, Zhiqi Huang, Chaobo Jia, Tao Jiang, Zhejun Jiang, Xinyi Jin, Yu Jing, Guokun Lai, Aidi Li, C. Li, Cheng Li, Fang Li, Guanghe Li, Guanyu Li, Haitao Li, Haoyang Li, Jia Li, Jingwei Li, Junxiong Li, Lincan Li, Mo Li, Weihong Li, Wentao Li, Xinhang Li, Xinhao Li, Yang Li, Yanhao Li, Yiwei Li, Yuxiao Li, Zhaowei Li, Zhaoxi Li, Zheming Li, Weilong Liao, Jiawei Lin, Xiaohan Lin, Yibo Lin, Zhishan Lin, Zichao Lin, Cheng Liu, Chenyu Liu, Hongzhang Liu, Liang Liu, Shaowei Liu, Shudong Liu, Shuran Liu, Tianwei Liu, Tianyu Liu, Weizhou Liu, Xiangyan Liu, Yangyang Liu, Yanming Liu, Yibo Liu, Yuanxin Liu, Zhengying Liu, Zhongnuo Liu, Enzhe Lu, Haoyu Lu, Zhiyuan Lu, G. Luo, Junyu Luo, Tongxu Luo, Yashuo Luo, Long Ma, Shaoguang Mao, Yuan Mei, Xin Men, Fanqing Meng, Zhiyong Meng, Yibo Miao, Minqing Ni, Kun Ouyang, Siyuan Pan, Bo Pang, Yuchao Qian, Ruoyu Qin, Zeyu Qin, Jiezhong Qiu, Bowen Qu, Zeyu Shang, Youbo Shao, Tianxiao Shen, Zhennan Shen, Juanfeng Shi, Lidong Shi, Shengyuan Shi, Feifan Song, Pengwei Song, Tianhui Song, Xiaoxi Song, Hongjin Su, Jianlin Su, Zhaochen Su, Lin Sui, Jinsong Sun, Junyao Sun, Tongyu Sun, Flood Sung, Yunpeng Tai, Chuning Tang, Heyi Tang, Xiaojuan Tang, Zhengyang Tang, Jiawen Tao, Shiyuan Teng, Chaoran Tian, Pengfei Tian, Bowen Wang, Chensi Wang, Chuang Wang, Congcong Wang, Dingkun Wang, Dinglu Wang, Dongliang Wang, Feng Wang, Hailong Wang, Haiming Wang, Hao Wang, Hengzhi Wang, Huaqing Wang, Hui Wang, Jiahao Wang, Jinhong Wang, Jiuzheng Wang, Kaixin Wang, Linian Wang, Qibin Wang, Shengjie Wang, Shuyi Wang, Si Wang, Wei Wang, Xiaochen Wang, Xinyuan Wang, Yao Wang, Yejie Wang, Yipu Wang, Yiqin Wang, Yucheng Wang, Yuzhi Wang, Zhaoji Wang, Zhaowei Wang, Zhengtao Wang, Zhexu Wang, Zifan Wang, Zihan Wang, Zizhe Wang, Chu Wei, Ming Wei, Chuan Wen, Zichen Wen, Chengjie Wu, Haoning Wu, Junyan Wu, Rucong Wu, Wenhao Wu, Yuefeng Wu, Yuhao Wu, Yuxin Wu, Zijian Wu, Chenjun Xiao, Jin Xie, Xiaotong Xie, Yuchong Xie, Bowei Xing, Boyu Xu, Jianfan Xu, Jing Xu, Jinjing Xu, L. H. Xu, Lin Xu, Suting Xu, Weixin Xu, Xinbo Xu, Xinran Xu, Yangchuan Xu, Yichang Xu, Yuemeng Xu, Zelai Xu, Ziyao Xu, Junjie Yan, Yuzi Yan, Guangyao Yang, Hao Yang, Junwei Yang, Kai Yang, Ningyuan Yang, Xiaofei Yang, Xinlong Yang, Xinyu Yang, Ying Yang, Yi Yang, Yi Yang, Zhen Yang, Zhilin Yang, Zonghan Yang, Haotian Yao, Dan Ye, Haoran Ye, Wenjie Ye, Zhuorui Ye, Peng Yebo, Bohong Yin, Chengzhen Yu, Longhui Yu, Tao Yu, Tianxiang Yu, Enming Yuan, Mengjie Yuan, Xiaokun Yuan, Yang Yue, Weihao Zeng, Dunyuan Zha, Haobing Zhan, Dehao Zhang, Hao Zhang, Jin Zhang, Puqi Zhang, Qiao Zhang, Rui Zhang, Xiaobin Zhang, Xiaoyun Zhang, Y. Zhang, Yadong Zhang, Yangkun Zhang, Yichi Zhang, Yizhi Zhang, Yongting Zhang, Yu Zhang, Yushun Zhang, Yutao Zhang, Yutong Zhang, Zheng Zhang, Chenguang Zhao, Feifan Zhao, Jinxiang Zhao, Shuai Zhao, Xiangyu Zhao, Xuanle Zhao, Yikai Zhao, Zijia Zhao, Huabin Zheng, Ruihan Zheng, Shaojie Zheng, Tengyang Zheng, Junfeng Zhong, Longguang Zhong, Weiming Zhong, M. Zhou, Runjie Zhou, Xinyu Zhou, Zaida Zhou, Jinguo Zhu, Liya Zhu, Xinhao Zhu, Yuxuan Zhu, Zhen Zhu, Jingze Zhuang, Weiyu Zhuang, Ying Zou, Xinxing Zu

机构 * Kimi Team(Kimi 团队)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Kimi K2.5通过联合优化文本和视觉模态,提出Agent Swarm框架,实现多模态代理智能的先进性能和高效任务处理。

Comments Kimi K2.5 tech report

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23054 2026-08-06 cs.CL cs.AI cs.LG 版本更新 67%

DeepImagine: Clinical Trial Outcome Prediction via Stepwise Local Counterfactual Imaginations

DeepImagine: 通过连续反事实想象学习生物医学推理

Youze Zheng, Jianyou Wang, Yuhan Chen, Matthew Feng, Longtian Bao, Hanyuan Zhang, Maxim Khan, Aditya K. Sehgal, Christopher D. Rosin, Umber Dube, Ramamohan Paturi

机构 * Laboratory for Emerging Intelligence, University of California, San Diego(新兴智能实验室,加州大学圣地亚哥分校) Department of Dermatology, University of California, San Diego(皮肤科系,加州大学圣地亚哥分校) University of Chicago(芝加哥大学) Elsevier(艾尔斯特出版社)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出DeepImagine框架,通过连续反事实想象训练语言模型进行生物医学推理,利用反事实对偶和强化学习提升临床试验预测性能,展示模型在生物医学领域的可解释性改进。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10599 2026-08-06 cs.CL cs.AI cs.LG 版本更新 67%

Emergence of Hierarchical Emotion Organization in Large Language Models

大型语言模型中层级情感组织的涌现

Maya Okawa, Bo Zhao, Eric J. Bigelow, Rose Yu, Tomer Ullman, Ekdeep Singh Lubana, Hidenori Tanaka

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学) University of Washington(华盛顿大学) University of Tokyo(东京大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 受情感轮理论启发,分析大型语言模型输出中情感状态间的概率依赖关系,发现模型自然形成与人类心理模型一致的层级情感树,且更大模型发展出更复杂的层级结构,同时揭示社会经济角色在情感识别中的系统性偏差。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06506 2026-08-06 cs.CL cs.AI cs.LG cs.MA 版本更新 67%

Pun Intended: Multi-Agent Translation of Wordplay with Contrastive Learning and Phonetic-Semantic Embeddings for CLEF JOKER 2025 Task 2

并非双关:结合对比学习与音义嵌入的多智能体双关语翻译方法,用于CLEF JOKER 2025任务2

Russell Taylor, Benjamin Herbert, Michael Sana

机构 * Georgia Institute of Technology(佐治亚理工学院) Peoples' Friendship University of Russia (RUDN University)(俄罗斯人民友谊大学) Joint Institute for Nuclear Research(联合核子研究中心) Vrije Universiteit Amsterdam(阿姆斯特丹自由大学) University of Skövde(斯德哥尔摩大学)

专题命中 复杂问题求解 :chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究针对跨语言双关语翻译难题,提出结合对比学习、音义嵌入与多智能体生成器-判别器框架的三阶段方法,在CLEF JOKER 2025任务2竞赛中获第一、第二名,推动了双关语翻译研究。

Journal ref CEUR Workshop Proceedings, Vol-4038, pp. 2870-2888, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03043 2026-07-21 cs.CL cs.AI cs.LG 版本更新 67%

Lil: Less is Less When Applying Post-Training Sparse-Attention Algorithms in Long-Decode Stage

Lil: 在长解码阶段应用后训练稀疏注意力算法时,少即是少

Junhao Hu, Fangze Li, Mingtao Xu, Feifan Meng, Shiju Zhao, Tiancheng Hu, Ting Peng, Anmin Liu, Wenrui Huang, Chenxu Liu, Ziyue Hua, Tao Xie

机构 * SCS, Peking University, Beijing, China(北京大学信息科学与技术学院,北京,中国) Key Lab of HCST (PKU), MOE, Beijing, China(高等教育出版社HCST重点实验室(PKU),北京,中国) State Key Laboratory for Novel Software Technology, Nanjing University, China(南京大学新型软件技术国家重点实验室,中国) Tencent, Shenzhen, China(腾讯,深圳,中国) Beijing Tongming Lake Information Technology Application Innovation Center, Beijing, China(北京 Tongming Lake 信息技术应用创新中心,北京,中国)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了在长解码阶段应用稀疏注意力算法时,信息丢失导致序列变长的问题,提出早停算法减少token消耗并降低精度损失。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25624 2026-07-21 cs.CR cs.AI cs.CL cs.LG 版本更新 67%

STAC: When Innocent Tools Form Dangerous Chains for LLM Agents

STAC:当无害工具形成危险链以劫持LLM代理

Jing-Jing Li, Jianfeng He, Chao Shang, Devang Kulshreshtha, Xun Xian, Yi Zhang, Hang Su, Sandesh Swamy, Yanjun Qi

机构 * AWS AI Labs(AWS人工智能实验室) UC Berkeley(伯克利大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 STAC通过多轮工具链攻击揭示LLM代理的安全漏洞,提出基于推理的防御策略,显著降低攻击成功率。

Comments Long version with 15 pages in main draft and a total of 39 pages including references and appendix. Data and code \url{https://github.com/amazon-science/MultiTurnAgentAttack}

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11132 2026-07-15 cs.CV 版本更新 67%

From Hindsight to Foresight: Self-Encouraged Hindsight Distillation for Knowledge-based Visual Question Answering

从回顾到前瞻:面向知识驱动视觉问答的自我鼓励回顾蒸馏

Yu Zhao, Ying Zhang, Xuhui Sui, Baohang Zhou, Xinying Qian, Li Shen, Dacheng Tao

机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract)

AI总结 本文提出HinD框架,通过知识鼓励偏好优化提升多模态大语言模型的知识推理能力,实验表明其在OK-VQA和A-OKVQA上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏