arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Fudan University(复旦大学)

共收录 1920
2506.02718 2026-04-21 cs.LG cs.AI

End-to-End Optimization of LLM-Driven Multi-Agent Search Systems via Heterogeneous-Group-Based Reinforcement Learning

通过异质组强化学习实现LLM驱动的多智能体搜索系统的端到端优化

Guanzhong Chen, Shaoxiong Yang, Chao Li, Wei Liu, Jian Luan, Zenglin Xu

机构 * MiLM Plus, Xiaomi Inc.(小米公司MiLM Plus实验室) Fudan University(复旦大学) Shanghai Academy of AI for Science(上海人工智能科学研究院)

AI总结 本文提出MHGPO方法,通过估计异质组间的相对优势,优化多智能体系统的整体成功而非单个智能体性能,提升了任务表现和计算效率。

Comments Accepted to ACL 2026 Main Conference. 20 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17091 2026-04-21 cs.CL

GenericAgent: A Token-Efficient Self-Evolving LLM Agent via Contextual Information Density Maximization (V1.0)

GenericAgent:通过上下文信息密度最大化实现的高效自演化大语言模型代理(V1.0)

Jiaqing Liang, Jinyi Han, Weijia Li, Xinyi Wang, Zhoujia Zhang, Zishang Jiang, Ying Liao, Tingyun Li, Ying Huang, Hao Shen, Hanyu Wu, Fang Guo, Keyi Wang, Zhonghua Hong, Zhiyu Lu, Lipeng Ma, Sihang Jiang, Yanghua Xiao

机构 * Advantage AI Agent Lab (A3 Lab)(优势人工智能代理实验室(A3实验室)) Shenzhen Aquaintelling Technology(深圳Aquaintelling科技) Fudan University(复旦大学)

AI总结 GenericAgent通过上下文信息密度最大化实现高效自演化,优于现有代理系统,且在token和交互上更节省。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17009 2026-04-21 cs.AI

Small Model as Master Orchestrator: Learning Unified Agent-Tool Orchestration with Parallel Subtask Decomposition

小模型作为主指挥者:通过并行子任务分解学习统一的智能体-工具协调

Wenzhen Yuan, Wutao Xiong, Fanchen Yu, Shengji Tang, Ting Liu, Tao Chen, Peng Ye, Yuzhuo Fu, Wanli Ouyang, Lei Bai

机构 * Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) Shanghai AI Lab(上海人工智能实验室) Sichuan University(四川大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出Agent-as-Tool框架,通过并行子任务分解和状态反馈提升多智能体系统协调效率,ParaManager在多个基准测试中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16916 2026-04-21 cs.CL

When Choices Become Risks: Safety Failures of Large Language Models under Multiple-Choice Constraints

当选择成为风险:在多选约束下大型语言模型的安全失败

Yuheng Chen, Zhiyu Wu, Bowen Cheng, Tetsuro Takahashi

机构 * Kagoshima University(鹿儿岛大学) Fudan University(复旦大学) China University of Petroleum-Beijing(中国石油大学(北京))

AI总结 研究发现,在多选约束下,LLM可能绕过拒绝行为,导致安全风险增加,揭示当前安全评估在结构化任务中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16890 2026-04-21 cs.AI

Step-GRPO: Internalizing Dynamic Early Exit for Efficient Reasoning

Step-GRPO:内化动态早期退出以实现高效推理

Benteng Chen, Weida Wang, Shufei Zhang, Mingbao Lin, Min Zhang

机构 * East China Normal University(东华大学) Shanghai AI Laboratory(上海人工智能实验室) Fudan University(复旦大学) Rakuten Singapore(乐天新加坡)

AI总结 Step-GRPO通过内化动态早期退出机制,优化推理过程,提升效率与准确性,在不同模型规模上实现更优的准确率与效率平衡。

Comments This paper has been accepted for publication at the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16788 2026-04-21 cs.RO

LongBench: Evaluating Robotic Manipulation Policies on Real-World Long-Horizon Tasks

LongBench:在真实世界长时域任务上评估机械臂策略

Xueyao Chen, Jingkai Jia, Tong Yang, Yibo Fu, Wei Li, Wenqiang Zhang

机构 * Fudan University(复旦大学)

AI总结 LongBench通过1000多个真实任务评估长时域机械臂策略,区分全观测和依赖上下文的两种模式,揭示执行鲁棒性和上下文推理的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16776 2026-04-21 cs.AI

SAVE: A Generalizable Framework for Multi-Condition Single-Cell Generation with Gene Block Attention

SAVE:一种多条件单细胞生成的通用框架,基于基因块注意力

Jiahao Li, Jiayi Dong, Peng Ye, Xiaochi Zhou, Haohai Lu, Fei Wang

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) Shanghai Key Laboratory of Intelligent Information Processing, Fudan University(复旦大学上海智能信息处理重点实验室)

AI总结 本文提出SAVE框架,通过基因块注意力和流匹配机制提升多条件单细胞生成的泛化能力,优于现有方法,尤其在低资源场景中表现突出。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16391 2026-04-21 cs.RO cs.CV

Disentangled Robot Learning via Separate Forward and Inverse Dynamics Pretraining

通过分离前向和逆向动力学预训练实现解耦的机器人学习

Wenyao Zhang, Bozhou Zhang, Zekun Qi, Wenjun Zeng, Xin Jin, Li Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) Eastern Institute of Technology, Ningbo(宁波东部技术研究所) Shanghai Innovation Institute(上海创新研究院) Tsinghua University(清华大学)

AI总结 本文提出DeFI框架,通过分离前向和逆向动力学预训练,利用不同数据源解决视觉-动作耦合问题,实现端到端微调,实验表明在CALVIN ABC-D和SimplerEnv上取得最佳性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16343 2026-04-21 cs.HC cs.AI

Elder-Sim: A Psychometrically Validated Platform for Personality-Stable Elderly Digital Twins

Elder-Sim:一种经过心理测量学验证的用于构建性格稳定的老年人数字孪生平台

Jiaqing Wang, Zhongfang Yang, Xingyuan Zhu, Zong'an Huang, Hao Wang, Li Tian, Ying Cao, Xiaomin Qu, Xiang Qi, Bei Wu, Zheng Zhu

机构 * Yulin AI-Enhanced HealthCare Lab(云林人工智能增强医疗实验室) School of Nursing, Fudan University(复旦大学护理学院) School of Nursing, Medical College of Soochow University(苏州大学医学院护理学院) School of Nursing, Dali University(大理大学护理学院) Department of Advanced Interdisciplinary Studies, The University of Tokyo(东京大学先进跨学科研究部) The First Affiliated Hospital of Soochow University(苏州大学第一附属医院) Department of Nursing, The First Affiliated Hospital, Jiangxi Medical College, Nanchang University(江西医学院护理部,南昌大学第一附属医院) School of Social Development, East China University of Political Science and Law(中国政法大学社会发展学院) Rory Meyers College of Nursing, New York University(纽约大学 Rory Meyers 护理学院) New York University Shanghai(纽约大学上海校区)

AI总结 本文提出Elder-Sim平台,通过心理测量学验证方法构建性格稳定的老年人数字孪生代理,利用认知概念化图和LoRA微调提升性格一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17550 2026-04-21 cs.LG cs.AI

MASPO: Unifying Gradient Utilization, Probability Mass, and Signal Reliability for Robust and Sample-Efficient LLM Reasoning

MASPO:统一梯度利用、概率质量与信号可靠性以实现鲁棒且样本高效的LLM推理

Xiaoliang Fu, Jiaye Lin, Yangyi Fang, Binbin Zheng, Chaowen Hu, Zekai Shao, Cong Qin, Lu Pan, Ke Zeng, Xunliang Cai

机构 * Meituan(美团) Fudan University(复旦大学) Tsinghua University(清华大学) University of Science and Technology of China(中国科学技术大学) Peking University(北京大学)

AI总结 MASPO通过统一框架解决RLVR方法中梯度利用低效、概率质量不敏感和信号可靠性不对称的问题,提升LLM推理的鲁棒性和样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14122 2026-04-21 cs.CV

EgoSound: Benchmarking Sound Understanding in Egocentric Videos

EgoSound:评估egocentric视频中声音理解的基准测试

Bingwen Zhu, Yuqian Fu, Qiaole Dong, Guolei Sun, Tianwen Qian, Yuzheng Wu, Danda Pani Paudel, Xiangyang Xue, Yanwei Fu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Nankai University(南开大学) East China Normal University(华东师范大学) KAUST(卡塔尔大学)

AI总结 EgoSound首次系统评估多模态大语言模型在egocentric视频中的声音理解能力,包含7个任务分类,揭示当前模型在空间和因果理解上的局限。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04638 2026-04-21 cs.CL cs.AI

SpeechMedAssist: Efficiently and Effectively Adapting Speech Language Models for Medical Consultation

SpeechMedAssist: 有效且高效地适应语音语言模型用于医疗咨询

Sirry Chen, Jieyi Wang, Wei Chen, Zhongyu Wei

机构 * Fudan University(复旦大学) Shanghai Innovation Institude(上海创新研究院) Peking University(北京大学) Huazhong University of Science and Technology(华中科技大学)

AI总结 本文提出SpeechMedAssist,一种能进行语音多轮交互的语音语言模型,通过分阶段训练减少对医疗语音数据的需求,提升医疗咨询场景下的效果和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10198 2026-04-20 cs.CL

HumanLLM: Benchmarking and Improving LLM Anthropomorphism via Human Cognitive Patterns

HumanLLM:通过人类认知模式基准测试和改进LLM拟人化

Xintao Wang, Jian Yang, Weiyuan Li, Rui Xie, Jen-tse Huang, Jun Gao, Shuai Huang, Yueping Kang, Yuanli Gou, Hongwei Feng, Yanghua Xiao

机构 * Fudan University(复旦大学) Hello Group(Hello集团) Johns Hopkins University(约翰霍普金斯大学)

AI总结 HumanLLM通过构建244种心理模式和11359种场景,评估LLM拟人化的有效性,发现认知建模比单纯模拟行为更重要,其8B模型在参数更少的情况下优于Qwen3-32B。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16004 2026-04-20 cs.CL cs.AI

AgentV-RL: Scaling Reward Modeling with Agentic Verifier

AgentV-RL: 通过代理验证器扩展奖励建模

Jiazheng Zhang, Ziche Fu, Zhiheng Xi, Wenqing Jing, Mingxu Chai, Wei He, Guoqiang Zhang, Chenghao Fan, Chenxin An, Wenxiang Chen, Zhicheng Liu, Haojie Pan, Dingwei Zhu, Tao Gui, Qi Zhang, Xuanjing Huang

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) Huazhong University of Science and Technology(华中科技大学) The University of Hong Kong(香港大学) ByteDance Seed(字节跳动种子) Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究院) Shanghai Key Laboratory of Multimodal Embodied AI(上海多模态具身人工智能重点实验室)

AI总结 本文提出Agentic Verifier框架,通过多轮工具增强的反思过程提升奖励建模效果,实验显示其在并行和顺序TTS任务中表现优异,4B变体超越现有最优ORMs 25.2%。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15938 2026-04-20 cs.RO

VADF: Vision-Adaptive Diffusion Policy Framework for Efficient Robotic Manipulation

VADF:面向高效机器人操作的视觉自适应扩散策略框架

Xinglei Yu, Zhenyang Liu, Shufeng Nan, Simo Wu, Yanwei Fu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

AI总结 本文提出VADF框架,通过视觉驱动的双适应方法减少训练收敛步骤并提升推理早期成功率,采用通用设计可无缝集成至任何扩散策略架构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15923 2026-04-20 cs.SD cs.CV

Hierarchical Codec Diffusion for Video-to-Speech Generation

层次编码扩散用于视频到语音生成

Jiaxin Ye, Gaoxiang Cong, Chenhui Wang, Xin-Cheng Wen, Zhaoyang Li, Boyuan Cao, Hongming Shan

机构 * Fudan University(复旦大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

AI总结 本文提出HiCoDiT,利用残差向量量化编码的层次结构,通过低层和高层块生成不同层级的语音令牌,以实现强音频视觉对齐,实验表明其在保真度和表达性上优于基线。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11698 2026-04-20 cs.CV cs.AI cs.CL

OSCBench: Benchmarking Object State Change in Text-to-Video Generation

OSCBench:文本到视频生成中对象状态变化的基准测试

Xianjing Han, Bin Zhu, Shiqi Hu, Franklin Mingzhe Li, Patrick Carrington, Roger Zimmermann, Jingjing Chen

机构 * National University of Singapore(新加坡国立大学) Singapore Management University(新加坡管理大学) Carnegie Mellon University(卡内基梅隆大学) Fudan University(复旦大学)

AI总结 本文提出OSCBench基准,用于评估文本到视频模型在对象状态变化上的性能,揭示当前模型在处理新场景时的不足。

Comments ACL 2026 Main Conference, Project page: https://hanxjing.github.io/OSCBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05547 2026-04-20 cs.CV cs.AI

VIB-Probe: Detecting and Mitigating Hallucinations in Vision-Language Models via Variational Information Bottleneck

VIB-Probe:通过变分信息瓶颈检测和缓解视觉-语言模型中的幻觉

Feiran Zhang, Yixin Wu, Zhenghua Wang, Xiaohua Wang, Changze Lv, Xuanjing Huang, Xiaoqing Zheng

机构 * College of Computer Science and Artificial Intelligence, Fudan University, Shanghai, China(复旦大学计算机科学与人工智能学院,上海,中国) Shanghai Key Laboratory of Intelligent Information Processing(上海智能信息处理重点实验室)

AI总结 本文提出VIB-Probe框架,通过变分信息瓶颈理论检测和缓解视觉-语言模型中的幻觉,利用注意力头提取判别模式并过滤语义噪声,实验表明其在多个基准上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04377 2026-04-20 cs.CL cs.AI cs.LG

Disco-RAG: Discourse-Aware Retrieval-Augmented Generation

Disco-RAG: 语篇意识的检索增强生成

Dongqi Liu, Hang Ding, Qiming Feng, Xurong Xie, Zhucun Xue, Chengjie Wang, Jian Li, Jiangning Zhang, Yabiao Wang

机构 * Saarland University(萨尔兰大学) Shanghai Jiaotong University(上海交通大学) Fudan University(复旦大学) Zhejiang University(浙江大学) Tencent YouTu Lab(腾讯优图实验室)

AI总结 Discourse-aware RAG框架通过构建篇章内结构树和跨篇章修辞图,提升知识整合能力,在问答和长文档摘要任务中取得最佳效果。

Comments ACL 2026 Main & Long Conference Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21977 2026-04-20 cs.AI

Distribution Shift Alignment Helps LLMs Simulate Survey Response Distributions

分布偏移对齐有助于LLM模拟调查响应分布

Ji Huang, Mengfei Li, Shuai Shao

机构 * School of Computer Science, University of Science and Technology of China(中国科学技术大学计算机科学学院) School of Management, Fudan University(复旦大学管理学院)

AI总结 本文提出DSA方法,通过两阶段微调对齐输出分布和偏移,提升LLM模拟调查响应的准确性与效率,在五个公开数据集上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16727 2026-04-20 cs.AI

Deliberative Searcher: Improving LLM Reliability via Reinforcement Learning with constraints

反思搜索器:通过带有约束的强化学习提高大语言模型的可靠性

Zhenyun Yin, Shujie Wang, Xuhong Wang, Xingjun Ma, Yinchun Wang

机构 * Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

AI总结 本文提出反思搜索器框架,结合置信度校准与基于检索的搜索,通过强化学习优化准确性,提升模型输出的可靠性。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21569 2026-04-20 cs.LG cs.AI cs.CL

ChemAmp: Amplified Chemistry Tools via Composable Agents

ChemAmp:通过可组合代理增强化学工具

Zhucong Li, Powei Chang, Jin Xiao, Zhijian Zhou, Qianyu He, Jiaqing Liang, Fenglei Cao, Xu Yinghui, Yuan Qi

机构 * Artificial Intelligence Innovation and Incubation Institute, Fudan University(复旦大学人工智能创新与孵化院) School of Data Science, Fudan University(复旦大学数据科学学院) College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) Department of Information and Intelligence Development, Zhongshan Hospital, Fudan University(复旦大学中山医院信息与智能发展部)

AI总结 ChemAmp通过优化动态协调提升化学工具能力,以有限数据构建任务专用超代理,在分子设计等任务中优于专用模型和通用LLM。

Comments Accepted to ACL 2026 Findings ; Code available at https://github.com/Chang-pw/ChemAmp

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07976 2026-04-20 stat.ML cs.LG

Two-Dimensional Deep ReLU CNN Approximation for Korobov Functions: A Constructive Approach

二维深度ReLU卷积神经网络对Korobov函数的近似:一种构造性方法

Qin Fang, Lei Shi, Min Xu, Ding-Xuan Zhou

机构 * Information and Engineering College, Dalian University(大连大学信息与工程学院) School of Mathematical Sciences and Shanghai Key Laboratory for Contemporary Applied Mathematics, Fudan University(复旦大学数学学院及上海当代应用数学重点实验室) School of Mathematical Sciences, Dalian University of Technology(大连理工大学数学学院) School of Mathematics and Statistics, University of Sydney(悉尼大学数学与统计学学院)

AI总结 本文研究二维深度卷积神经网络对Korobov函数的近似能力,提出构造性方法构建网络并分析复杂度,证明在连续权重选择模型下近似率接近最优,缓解维度诅咒。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20689 2026-04-20 cs.AI cs.CL

WiseMind: a knowledge-guided multi-agent framework for accurate and empathetic psychiatric diagnosis

WiseMind: 一种基于知识的多智能体框架,用于准确且富有同理心的精神病诊断

Yuqi Wu, Guangya Wan, Jingjing Li, Shengming Zhao, Lingfeng Ma, Tianyi Ye, Ion Pop, Yanbo Zhang, Jie Chen

机构 * College of Biomedical Engineering(生物医学工程学院) Fudan University(复旦大学) Department of Electrical and Computer Engineering(电气与计算机工程系) University of Alberta(阿尔伯塔大学) University of Virginia(弗吉尼亚大学) McIntire School of Commerce(麦金尼商学院) School of Data Science(数据科学学院) Department of Psychiatry(精神病学系)

AI总结 WiseMind通过整合理性与情感智能体,结合DSM-5知识图谱,提升了精神病诊断的准确性与同理心,其在1206次模拟对话和180次真实交互中达到85.6%的诊断准确率,超越了单智能体方法。

Comments Accepted at npj Digital Medicine (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06915 2026-04-20 cs.DC cs.LG

Analytic Personalized Federated Meta-Learning

分析性个性化联邦元学习

Shunxian Gu, Chaoqun You, Deke Guo, Zhihao Qu, Bangbang Ren, Zaipeng Xie, Lailong Luo

机构 * National University of Defense Technology(国防科技大学) Fudan University(复旦大学) Hohai University(河海大学)

AI总结 本文提出FedACnnL和pFedACnnL框架,通过层间DNN协作训练和分析性本地目标求解,解决联邦学习中异构数据分布导致的性能下降问题,提升测试准确率和模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15065 2026-04-17 cs.CV

Learning Where to Embed: Noise-Aware Positional Embedding for Query Retrieval in Small-Object Detection

学习嵌入位置:面向小目标检测查询检索的噪声感知位置嵌入

Yangchen Zeng, Zhenyu Yu, Dongming Jiang, Wenbo Zhang, Yifan Hong, Zhanhua Hu, Jiao Luo, Kangning Cui

机构 * Southeast University(东南大学) Fudan University(复旦大学) The University of Texas at Dallas(德克萨斯大学达拉斯分校) Zhejiang Normal University(浙江师范大学) Data Space Research Institute, Hefei Comprehensive National Science Center(合肥综合国家科学中心数据空间研究院) Rice University(里士满大学) Huazhong Agricultural University(华中农业大学) City University of Hong Kong (Dongguan)(香港城市大学(东莞)) Wake Forest University(威克森林大学)

AI总结 本文提出HELP框架,通过选择性保留前景区域的位置编码来学习嵌入位置,结合热图引导的位置嵌入机制和线性蛇卷积提升小目标检索性能,实现参数减少59.4%的同时保持精度。

Comments Accepted to ACM ICMR 2026; 14 pages, 6 figures, and 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14877 2026-04-17 cs.LG

Does RL Expand the Capability Boundary of LLM Agents? A PASS@(k,T) Analysis

强化学习是否扩展大语言模型代理的能力边界?一种PASS@(k,T)分析

Zhiyuan Zhai, Wenjing Yan, Xiaodan Shao, Xin Wang

机构 * Fudan University(复旦大学) Chinese University of Hong Kong(香港中文大学) University of Waterloo(滑铁卢大学)

AI总结 本文通过PASS@(k,T)指标分析强化学习在代理工具使用中的能力扩展,发现其在复杂任务中确实扩大了能力边界,而静态推理中则趋于收敛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14853 2026-04-17 cs.LG

Adaptive Test-Time Compute Allocation for Reasoning LLMs via Constrained Policy Optimization

通过约束策略优化实现推理大语言模型的自适应推理时间计算分配

Zhiyuan Zhai, Bingcong Li, Bingnan Xiao, Ming Li, Xin Wang

机构 * Fudan University(复旦大学) ETH Zurich(苏黎世联邦理工学院) Guangming Lab(光明实验室)

AI总结 本文提出通过约束优化问题解决推理时间计算分配问题,采用两阶段解决-学习流程,在解决阶段利用拉格朗日松弛分解全局约束,学习阶段训练轻量分类器预测 oracle 动作,实验证明方法在 MATH 和 GSM8K 数据集上优于均匀和启发式分配基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14847 2026-04-17 cs.AI

TrigReason: Trigger-Based Collaboration between Small and Large Reasoning Models

TrigReason:基于触发的大小推理模型协作

Yi Zhao, Yajuan Peng, Cam-Tu Nguyen, Zuchao Li, Xiaoliang Wang, Xiaoming Fu, Hai Zhao

机构 * AGI Institute, School of Computer Science, Shanghai Jiao Tong University, Shanghai, China(AGI研究院,计算机科学学院,上海交通大学,上海,中国) Key Laboratory of Shanghai Education Commission for Intelligent Interaction and Cognitive Engineering, Shanghai Jiao Tong University, Shanghai, China(上海市教育委员会智能交互与认知工程重点实验室,上海交通大学,上海,中国) Shanghai Key Laboratory for Intelligent Information Processing, Fudan University(上海市智能信息处理重点实验室,复旦大学) State Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学) School of Artificial Intelligence, Wuhan University(人工智能学院,武汉大学) Institute of Computer Science, University of Göttingen, Göttingen, Germany(计算机科学研究所,哥廷根大学,哥廷根,德国)

AI总结 本文提出TrigReason框架,通过触发机制将大部分推理任务交给小型模型,仅在必要时调用大模型,提升推理效率与准确性。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14806 2026-04-17 cs.SD cs.MM

Listen, Pause, and Reason: Toward Perception-Grounded Hybrid Reasoning for Audio Understanding

倾听、暂停与推理:迈向基于感知的混合推理以实现音频理解

Jieyi Wang, Yazhe Niu, Dexuan Xu, Zhongyu Wei

机构 * Shanghai AI Laboratory(上海人工智能实验室) Peking University(北京大学) CUHK MMLab(香港中文大学多媒体实验室) Fudan University(复旦大学)

AI总结 本文提出HyPeR框架,通过感知-推理混合方法提升音频理解能力,通过PAQA数据集训练模型并引入PAUSE标记和一致性奖励,实验表明其在复杂音频场景中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏