arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Fudan University(复旦大学)

2026-04-17 至 2026-04-17 共收录 11
2604.15065 2026-04-17 cs.CV

Learning Where to Embed: Noise-Aware Positional Embedding for Query Retrieval in Small-Object Detection

学习嵌入位置:面向小目标检测查询检索的噪声感知位置嵌入

Yangchen Zeng, Zhenyu Yu, Dongming Jiang, Wenbo Zhang, Yifan Hong, Zhanhua Hu, Jiao Luo, Kangning Cui

机构 * Southeast University(东南大学) Fudan University(复旦大学) The University of Texas at Dallas(德克萨斯大学达拉斯分校) Zhejiang Normal University(浙江师范大学) Data Space Research Institute, Hefei Comprehensive National Science Center(合肥综合国家科学中心数据空间研究院) Rice University(里士满大学) Huazhong Agricultural University(华中农业大学) City University of Hong Kong (Dongguan)(香港城市大学(东莞)) Wake Forest University(威克森林大学)

AI总结 本文提出HELP框架,通过选择性保留前景区域的位置编码来学习嵌入位置,结合热图引导的位置嵌入机制和线性蛇卷积提升小目标检索性能,实现参数减少59.4%的同时保持精度。

Comments Accepted to ACM ICMR 2026; 14 pages, 6 figures, and 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14877 2026-04-17 cs.LG

Does RL Expand the Capability Boundary of LLM Agents? A PASS@(k,T) Analysis

强化学习是否扩展大语言模型代理的能力边界?一种PASS@(k,T)分析

Zhiyuan Zhai, Wenjing Yan, Xiaodan Shao, Xin Wang

机构 * Fudan University(复旦大学) Chinese University of Hong Kong(香港中文大学) University of Waterloo(滑铁卢大学)

AI总结 本文通过PASS@(k,T)指标分析强化学习在代理工具使用中的能力扩展,发现其在复杂任务中确实扩大了能力边界,而静态推理中则趋于收敛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14853 2026-04-17 cs.LG

Adaptive Test-Time Compute Allocation for Reasoning LLMs via Constrained Policy Optimization

通过约束策略优化实现推理大语言模型的自适应推理时间计算分配

Zhiyuan Zhai, Bingcong Li, Bingnan Xiao, Ming Li, Xin Wang

机构 * Fudan University(复旦大学) ETH Zurich(苏黎世联邦理工学院) Guangming Lab(光明实验室)

AI总结 本文提出通过约束优化问题解决推理时间计算分配问题,采用两阶段解决-学习流程,在解决阶段利用拉格朗日松弛分解全局约束,学习阶段训练轻量分类器预测 oracle 动作,实验证明方法在 MATH 和 GSM8K 数据集上优于均匀和启发式分配基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14847 2026-04-17 cs.AI

TrigReason: Trigger-Based Collaboration between Small and Large Reasoning Models

TrigReason:基于触发的大小推理模型协作

Yi Zhao, Yajuan Peng, Cam-Tu Nguyen, Zuchao Li, Xiaoliang Wang, Xiaoming Fu, Hai Zhao

机构 * AGI Institute, School of Computer Science, Shanghai Jiao Tong University, Shanghai, China(AGI研究院,计算机科学学院,上海交通大学,上海,中国) Key Laboratory of Shanghai Education Commission for Intelligent Interaction and Cognitive Engineering, Shanghai Jiao Tong University, Shanghai, China(上海市教育委员会智能交互与认知工程重点实验室,上海交通大学,上海,中国) Shanghai Key Laboratory for Intelligent Information Processing, Fudan University(上海市智能信息处理重点实验室,复旦大学) State Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学) School of Artificial Intelligence, Wuhan University(人工智能学院,武汉大学) Institute of Computer Science, University of Göttingen, Göttingen, Germany(计算机科学研究所,哥廷根大学,哥廷根,德国)

AI总结 本文提出TrigReason框架,通过触发机制将大部分推理任务交给小型模型,仅在必要时调用大模型,提升推理效率与准确性。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14806 2026-04-17 cs.SD cs.MM

Listen, Pause, and Reason: Toward Perception-Grounded Hybrid Reasoning for Audio Understanding

倾听、暂停与推理:迈向基于感知的混合推理以实现音频理解

Jieyi Wang, Yazhe Niu, Dexuan Xu, Zhongyu Wei

机构 * Shanghai AI Laboratory(上海人工智能实验室) Peking University(北京大学) CUHK MMLab(香港中文大学多媒体实验室) Fudan University(复旦大学)

AI总结 本文提出HyPeR框架,通过感知-推理混合方法提升音频理解能力,通过PAQA数据集训练模型并引入PAUSE标记和一致性奖励,实验表明其在复杂音频场景中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14768 2026-04-17 cs.AI

CoTEvol: Self-Evolving Chain-of-Thoughts for Data Synthesis in Mathematical Reasoning

CoTEvol:用于数学推理数据合成的自演化思维链

Zhuo Wang, Zhuo Zhang, Yafu Li, Yu Cheng, Lizhen Qu, Zenglin Xu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) The Chinese University of Hong Kong(香港中文大学) Monash University(墨尔本大学) Independent Researcher(独立研究者) Shanghai Academy of AI for Science(上海人工智能科学研究院)

AI总结 本文提出CoTEvol,一种基于遗传算法的思维链生成框架,通过全局交叉和局部突变提升生成准确性和多样性,实验表明其在数学推理任务中效果优于传统方法。

Comments acl2026 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14568 2026-04-17 cs.CV cs.CL

Learning Adaptive Reasoning Paths for Efficient Visual Reasoning

学习高效的视觉推理路径

Yixu Huang, Tinghui Zhu, Muhao Chen

机构 * Fudan University(复旦大学) University of California, Davis(加州大学戴维斯分校)

AI总结 本文提出AVR框架,通过分解视觉推理为三个认知功能,动态选择响应格式,减少推理冗余,提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14168 2026-04-17 cs.CL cs.AI

SAGE Celer 2.6 Technical Card

SAGE Celer 2.6 技术卡片

SAGEA Research Team, Basab Jha, Firoj Paudel, Ujjwal Puri, Adrian Liu, Ethan Henkel, Zhang Yuting, Mateusz Kowalczyk, Mei Huang, Choi Donghyuk, Wang Junhao

机构 * SAGEA Tribhuwan University(特里布文大学) Vedas College(维达斯学院) Madan Bhandari Memorial College(马达恩·巴恩迪纪念学院) Fudan University(复旦大学) ETH Zurich(苏黎世联邦理工学院)

AI总结 SAGE Celer 2.6 通过逆向推理管道优化逻辑路径,支持多模态功能,并针对南亚语言进行优化,在数学、编程和一般智能基准测试中表现优异。

Comments 28 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09057 2026-04-17 cs.CV cs.MM cs.SD

Tora3: Trajectory-Guided Audio-Video Generation with Physical Coherence

Tora3:基于轨迹的音频视频生成与物理一致性

Junchao Liao, Zhenghao Zhang, Xiangyu Meng, Litao Li, Ziying Zhang, Siyu Zhu, Long Qin, Weizhi Wang

机构 * Alibaba Cloud Computing(阿里巴巴云 computing) Fudan University(复旦大学)

AI总结 Tora3通过引入轨迹作为共享的运动先验,提升音频视频生成的物理一致性,采用轨迹对齐的运动表示和混合流匹配方案,改进运动真实性和运动-声音同步性。

Comments 12 pages, 5 tables, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05541 2026-04-17 cs.CV

EchoAgent: Towards Reliable Echocardiography Interpretation with "Eyes","Hands" and "Minds"

EchoAgent:迈向可靠超声心动图解读的“眼、手、脑”系统

Qin Wang, Zhiqing He, Yu Liu, Bowen Guo, Zeju Li, Miao Zhao, Wenhao Ju, Zhiling Luo, Xianhong Shu, Yi Guo, Yuanyuan Wang

机构 * Fudan University(复旦大学) Fudan Zhongshan Hospital(复旦中山医院) Fuwai Yunnan Hospital(阜外云南医院) Fuwai Beijing Hospital(阜外北京医院)

AI总结 本文提出EchoAgent,通过整合视觉、手动操作与专家知识,实现端到端的超声心动图解读,提升临床可靠性与实用性。

Comments Accepted by CVPR 2026 CV4Clinical, 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03341 2026-04-17 cs.AI

What Deserves Memory: Adaptive Memory Distillation for LLM Agents

哪些信息值得记忆:面向大语言模型代理的自适应记忆蒸馏

Wenquan Ma, Jiayan Nan, Wenlong Wu, Yize Chen

机构 * Fudan University(复旦大学) Shanda Group(上海莎anda集团) Beihang University(北航) Shanghai University of Finance and Economics(上海财经大学)

AI总结 本文提出NEMORI框架,通过预测性来评估经验的未来效用,实现自适应记忆蒸馏,提升LLM代理的记忆性能与存储效率。

详情

展开后加载摘要…

URL PDF HTML 收藏