arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Science and Technology of China(中国科学技术大学)

共收录 2226
2604.16886 2026-04-21 cs.RO

Chain Of Interaction Benchmark (COIN): When Reasoning meets Embodied Interaction

交互链基准(COIN):当推理遇见具身交互

Xianhao Wang, Xiaojian Ma, Haozhe Hu, Rongpeng Su, Yutian Cheng, Zhou Ziheng, Hangxin Liu, Lei Liu, Bin Li, Qing Li

机构 * University of Science and Technology of China(中国科学技术大学) Beijing Institute for General Artificial Intelligence (BIGAI)(北京通用人工智能研究院) Xidian University(西安电子科技大学) Shanghai Jiao Tong University(上海交通大学) University of California, Los Angeles(加州大学洛杉矶分校)

AI总结 COIN基准通过设计日常场景下的50个交互任务,评估机器人在部分可观测环境下进行因果依赖推理的能力,揭示现有方法在交互推理任务中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16541 2026-04-21 cs.CV

BOOKAGENT: Orchestrating Safety-Aware Visual Narratives via Multi-Agent Cognitive Calibration

BOOKAGENT:通过多智能体认知校准 orchestrate 安全意识的视觉叙述

Bo Gao, Chang Liu, Yuyang Miao, Siyuan Ma, Ser-Nam Lim

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Science and Technology of China(中国科学技术大学) Imperial College London(伦敦帝国理工学院) Nanyang Technological University(南洋理工大学) University of Central Florida(佛罗里达中央大学)

AI总结 本文提出BOOKAGENT,一种安全意识的多智能体协作框架,用于高质量的视觉叙述生成,通过联合规划、脚本、插图和全局修复不一致,提升叙述连贯性和视觉一致性。

Comments 18 pages, Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16462 2026-04-21 cs.CV cs.AI

From Inheritance to Saturation: Disentangling the Evolution of Visual Redundancy for Architecture-Aware MLLM Inference Acceleration

从继承到饱和:解构视觉冗余的演化以实现架构感知的MLLM推理加速

Jiaqi Shi, Yuechan Li, Xulong Zhang, Xiaoyang Qu, Jianzong Wang

机构 * University of Science and Technology of China(中国科学技术大学) Wuhan University(武汉大学) Ping An Technology (Shenzhen) Co., Ltd.(平安科技(深圳)有限公司)

AI总结 本文提出HalfV框架,通过统一剪枝策略缓解内在视觉冗余,并根据具体表现适应性处理二次饱和冗余,实现跨架构的高效推理。

Comments 16 pages, 14 figures, plus appendix, accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20187 2026-04-21 cs.CV

MuSteerNet: Human Reaction Generation from Videos via Observation-Reaction Mutual Steering

MuSteerNet:通过观察-反应相互引导生成人类反应

Yuan Zhou, Yongzhi Li, Yanqi Dai, Xingyu Zhu, Yi Tan, Qingshan Xu, Beier Zhu, Richang Hong, Hanwang Zhang

机构 * Nanyang Technological University(南洋理工大学) National University of Singapore(新加坡国立大学) Renmin University of China(中国人民大学) University of Science and Technology of China(中国科学技术大学) Hefei University of Technology(合肥工业大学)

AI总结 本文提出MuSteerNet,通过观察-反应相互引导机制生成3D人类动作,解决视频输入对反应生成的引导不足问题,提升反应质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17550 2026-04-21 cs.LG cs.AI

MASPO: Unifying Gradient Utilization, Probability Mass, and Signal Reliability for Robust and Sample-Efficient LLM Reasoning

MASPO:统一梯度利用、概率质量与信号可靠性以实现鲁棒且样本高效的LLM推理

Xiaoliang Fu, Jiaye Lin, Yangyi Fang, Binbin Zheng, Chaowen Hu, Zekai Shao, Cong Qin, Lu Pan, Ke Zeng, Xunliang Cai

机构 * Meituan(美团) Fudan University(复旦大学) Tsinghua University(清华大学) University of Science and Technology of China(中国科学技术大学) Peking University(北京大学)

AI总结 MASPO通过统一框架解决RLVR方法中梯度利用低效、概率质量不敏感和信号可靠性不对称的问题,提升LLM推理的鲁棒性和样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09536 2026-04-21 cs.AI

Omni-R1: Towards the Unified Generative Paradigm for Multimodal Reasoning

Omni-R1:迈向多模态推理的统一生成范式

Dongjie Cheng, Yongqi Li, Zhixin Ma, Hongru Cai, Yupeng Hu, Wenjie Wang, Liqiang Nie, Wenjie Li

机构 * The Hong Kong Polytechnic University(香港理工大学) Singapore Management University(新加坡国立大学) Shandong University(山东大学) University of Science and Technology of China(中国科学技术大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

AI总结 本文提出Omni-R1,通过生成中间图像统一多模态推理技能,解决单一任务特定推理模式限制的问题,并引入Omni-R1-Zero无需多模态标注实现文本仅推理数据的逐步可视化。

Comments Accepted by ACL2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13759 2026-04-21 cs.CV

Uni-MMMU: A Massive Multi-discipline Multimodal Unified Benchmark

Uni-MMMU:一个大规模多学科多模态统一基准

Kai Zou, Ziqi Huang, Yuhao Dong, Shulin Tian, Dian Zheng, Hongbo Liu, Jingwen He, Bin Liu, Yu Qiao, Ziwei Liu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) S-Lab, Nanyang Technological University(南洋理工大学S实验室) University of Science and Technology of China(中国科学技术大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 Uni-MMMU通过八个以推理为中心的领域系统展开生成与理解的双向协同,评估模型在视觉理解和生成方面的性能差异及跨模态依赖,为统一模型发展提供可靠基础。

Comments Equal contributions from frst three authors. Project page: https://vchitect.github.io/Uni-MMMU-Project/ Code: https://github.com/vchitect/Uni-MMMU

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02547 2026-04-21 cs.AI cs.CL

The Landscape of Agentic Reinforcement Learning for LLMs: A Survey

代理强化学习用于大语言模型的景观:综述

Guibin Zhang, Hejia Geng, Xiaohang Yu, Zhenfei Yin, Zaibin Zhang, Zelin Tan, Heng Zhou, Zhongzhi Li, Xiangyuan Xue, Yijiang Li, Yifan Zhou, Yang Chen, Chen Zhang, Yutao Fan, Zihu Wang, Songtao Huang, Francisco Piedrahita-Velez, Yue Liao, Hongru Wang, Mengyue Yang, Heng Ji, Jun Wang, Shuicheng Yan, Philip Torr, Lei Bai

机构 * University of Oxford(牛津大学) Shanghai AI Laboratory(上海人工智能实验室) National University of Singapore(新加坡国立大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Brown University(布朗大学) University College London(伦敦大学学院) University of Science and Technology of China(中国科学技术大学) Imperial College London(伦敦帝国学院) Dalian University of Technology(大连理工大学) Chinese Academy of Sciences(中国科学院) The Chinese University of Hong Kong(香港中文大学) University of Georgia(佐治亚大学) University of California, San Diego(加州大学圣地亚哥分校) University of California, Santa Barbara(加州大学圣塔芭芭拉分校) University of Bristol(布里斯托大学)

AI总结 本文综述了代理强化学习在大语言模型中的应用,提出双分类体系,探讨其核心能力与应用领域,并强调强化学习在使能力转化为适应性行为中的关键作用。

Comments Published on Transactions on Machine Learning Research: https://openreview.net/forum?id=RY19y2RI1O

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15237 2026-04-20 cs.CV

StreamCacheVGGT: Streaming Visual Geometry Transformers with Robust Scoring and Hybrid Cache Compression

StreamCacheVGGT:具有鲁棒评分和混合缓存压缩的流式视觉几何变换

Xuanyi Liu, Chunan Yu, Deyi Ji, Qi Zhu, Lingyun Sun, Xuanfu Li, Jin Ma, Tianrun Chen, Lanyun Zhu

机构 * Peking University(北京大学) Nanjing University of Science and Technology(南京理工大学) University of Science and Technology of China(中国科学技术大学) Zhejiang University(浙江大学) Huawei(华为) Tongji University(同济大学)

AI总结 本文提出StreamCacheVGGT框架,通过Cross-Layer Consistency-Enhanced Scoring和Hybrid Cache Compression模块,解决流式视频中稳定重建密集3D几何的问题,实现高精度和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25300 2026-04-20 cs.LG cs.AI

Scaling Behaviors of LLM Reinforcement Learning Post-Training: An Empirical Study in Mathematical Reasoning

LLM强化学习后训练的扩展行为:数学推理中的实证研究

Zelin Tan, Hejia Geng, Xiaohang Yu, Mulei Zhang, Guancheng Wan, Yifan Zhou, Qiang He, Xiangyuan Xue, Heng Zhou, Yutao Fan, Zhongzhi Li, Zaibin Zhang, Guibin Zhang, Chen Zhang, Zhenfei Yin, Philip Torr, Lei Bai

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai AI Laboratory(上海人工智能实验室) University of Oxford(牛津大学) Imperial College London(伦敦帝国学院) University of Georgia(佐治亚大学) The Chinese University of Hong Kong(香港中文大学) Chinese Academy of Sciences(中国科学院) Dalian University of Technology(大连理工大学) National University of Singapore(新加坡国立大学) Wuhan University(武汉大学)

AI总结 本文通过实证研究探讨了LLM后训练强化学习中的扩展行为,重点分析了模型规模、数据量和计算预算对数学推理性能的影响,揭示了学习效率的饱和趋势及高质量数据重复利用的有效性。

Comments V4 version:This Paper has been accepted by ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16011 2026-04-20 cs.CV cs.SD physics.geo-ph

Breakout-picker: Reducing false positives in deep learning-based borehole breakout characterization from acoustic image logs

Breakout-picker: 通过减少深度学习在声成像测井中破译假阳性

Guangyu Wang, Xiaodong Ma, Xinming Wu

机构 * State Key Laboratory of Precision Geodesy, School of Earth and Space Sciences, University of Science and Technology of China(精密测绘国家重点实验室,地球与空间科学学院,中国科学技术大学) Mengcheng National Geophysical Observatory, University of Science and Technology of China(孟城国家地震观测站,中国科学技术大学)

AI总结 本文提出Breakout-picker框架,通过引入非破译特征负样本和方位对称性验证,提升声成像测井中破译的准确性与可靠性,降低假阳性率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15750 2026-04-20 cs.LG cs.AI

DepCap: Adaptive Block-Wise Parallel Decoding for Efficient Diffusion LM Inference

DepCap:适应性分块并行解码用于高效扩散语言模型推理

Xiang Xia, Wuyang Zhang, Jiazheng Liu, Cheng Yan, Yanyong Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院)

AI总结 本文提出DepCap框架,通过自适应分块解码提升扩散语言模型推理效率,实现生成质量与速度的平衡,实验表明在多个模型和任务中达到显著加速效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15675 2026-04-20 cs.CL

C-Mining: Unsupervised Discovery of Seeds for Cultural Data Synthesis via Geometric Misalignment

C-Mining:通过几何偏移无监督发现文化数据合成的种子

Pufan Zeng, Yilun Liu, Mingchen Dai, Mengyao Piao, Chunguang Zhao, Lingqi Miao, Shimin Tao, Weibin Meng, Minggui He, Chenxin Liu, Zhenzhen Qin, Li Zhang, Hongxia Ma, Boxing Chen, Daimeng Wei

机构 * Huawei China(华为中国) Huawei Canada(华为加拿大) University of Science and Technology of China(中国科学技术大学)

AI总结 本文提出C-Mining框架,通过几何偏移发现文化种子,提升文化理解与推理能力,实验显示在CulturalBench-Hard上提升6.03分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15621 2026-04-20 cs.IR cs.AI cs.CL

Rethinking the Necessity of Adaptive Retrieval-Augmented Generation through the Lens of Adaptive Listwise Ranking

重新审视通过适应性列表排序视角的适应性检索增强生成的必要性

Jun Feng, Jiahui Tang, Zhicheng He, Hang Lv, Hongchao Gu, Hao Wang, Xuezhi Yang, Shuai Fang

机构 * Hefei University of Technology(合肥工业大学) University of Science and Technology of China(中国科学技术大学)

AI总结 本文通过适应性列表排序视角重新审视适应性检索增强生成的必要性,提出AdaRankLLM框架,通过零样本提示和段落dropout机制验证适应性排序的必要性,并通过两阶段渐进蒸馏提升小模型的精确排序与适应过滤能力。

Comments 7pages, 2figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13846 2026-04-20 cs.CL

Beyond Static Personas: Situational Personality Steering for Large Language Models

超越静态人设:面向大语言模型的情境性人格引导

Zesheng Wei, Mengxiang Li, Zilei Wang, Yang Deng

机构 * University of Science and Technology of China(中国科学技术大学) Singapore Management University(新加坡国立大学)

AI总结 本文提出IRIS框架,通过分析人设神经元揭示情境依赖性,实现无训练的神经元引导方法,在PersonalityBench和SPBench上验证了其在复杂情境下的泛化与鲁棒性。

Comments Accepted to Findings of ACL2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01566 2026-04-20 cs.CL

FS-Researcher: Test-Time Scaling for Long-Horizon Research Tasks with File-System-Based Agents

FS-Researcher:基于文件系统的长周期研究任务测试时扩展

Chiwei Zhu, Benfeng Xu, Mingxuan Du, Shaohan Wang, Xiaorui Wang, Zhendong Mao, Yongdong Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Metastone Technology(MetaStone技术公司)

AI总结 本文提出FS-Researcher框架,通过持久化工作空间实现长周期研究任务的测试时扩展,采用双代理结构提升研究质量与扩展性。

Comments 22 pages, 6 figures; Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21977 2026-04-20 cs.AI

Distribution Shift Alignment Helps LLMs Simulate Survey Response Distributions

分布偏移对齐有助于LLM模拟调查响应分布

Ji Huang, Mengfei Li, Shuai Shao

机构 * School of Computer Science, University of Science and Technology of China(中国科学技术大学计算机科学学院) School of Management, Fudan University(复旦大学管理学院)

AI总结 本文提出DSA方法,通过两阶段微调对齐输出分布和偏移,提升LLM模拟调查响应的准确性与效率,在五个公开数据集上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10959 2026-04-20 cs.LG cs.AI cs.CL stat.ML

Revisiting Entropy Regularization: Adaptive Coefficient Unlocks Its Potential for LLM Reinforcement Learning

重新审视熵正则化:自适应系数解锁其在大语言模型强化学习中的潜力

Xiaoyun Zhang, Xiaojian Yuan, Di Huang, Wang You, Chen Hu, Jingqing Ruan, Ai Jian, Kejiang Chen, Xing Hu

机构 * State Key Lab of Processors, Institute of Computing Technology, CAS(处理器国家重点实验室,计算技术研究所,中国科学院) University of Science and Technology of China(中国科学技术大学) University of Chinese Academy of Sciences(中国科学院大学) StepFun Inc(StepFun公司)

AI总结 本文重新审视熵正则化在强化学习中的应用,提出自适应熵正则化框架,通过动态平衡探索与利用提升数学推理性能。

Comments 16 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13215 2026-04-20 cs.CV

DVP-MVS++: Synergize Depth-Normal-Edge and Harmonized Visibility Prior for Multi-View Stereo

DVP-MVS++: 融合深度-法线-边缘与协调视图先验以实现多视图立体摄影

Zhenlong Yuan, Dapeng Zhang, Zehao Li, Chengxuan Qian, Jianing Chen, Yinda Chen, Kehua Chen, Tianlu Mao, Zhaoxin Li, Hao Jiang, Zhaoqi Wang

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) DSLAB, School of Information Science & Engineering, Lanzhou University(兰州大学信息科学与工程学院DSLAB) School of Mathematical Science, Jiangsu University(江苏大学数学学院) MoE Key Laboratory of Brain-inspired Intelligent Perception and Cognition, University of Science and Technology of China(中国科学技术大学脑科学与智能感知教育部重点实验室) Agricultural Information Institute, Chinese Academy of Agricultural Sciences(中国农业科学院农业信息研究所) Key Laboratory of Agricultural Big Data, Ministry of Agriculture and Rural Affairs(农业农村部农业大数据重点实验室)

AI总结 本文提出DVP-MVS++方法,通过融合深度-法线-边缘对齐和协调跨视图先验,提升多视图立体摄影中鲁棒性和视图感知的补丁变形能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14930 2026-04-17 cs.CL

IE as Cache: Information Extraction Enhanced Agentic Reasoning

信息提取作为缓存:增强代理推理

Hang Lv, Sheng Liang, Hongchao Gu, Wei Guo, Defu Lian, Yong Liu, Hao Wang, Enhong Chen

机构 * University of Science and Technology of China(中国科学技术大学) Huawei Technologies Co., Ltd(华为技术有限公司)

AI总结 本文提出IE-as-Cache框架,将信息提取用作认知缓存以提升代理推理能力,通过查询驱动提取与缓存感知推理动态维护紧凑中间信息并过滤噪声,实验表明在多种LLM上显著提升推理准确性。

Comments 8pages, 2figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10120 2026-04-17 cs.MA cs.AI cs.CL

TopoDIM: One-shot Topology Generation of Diverse Interaction Modes for Multi-Agent Systems

TopoDIM:多智能体系统中多样化交互模式的一键拓扑生成

Rui Sun, Jie Ding, Chenghua Gong, Tianjun Gu, Yihang Jiang, Juyuan Zhang, Liming Pan, Linyuan Lü

机构 * University of Science and Technology of China(中国科学技术大学) East China Normal University(华东师范大学)

AI总结 TopoDIM通过一键生成拓扑结构,实现多智能体系统中多样化交互模式,提升任务性能和token效率,实验表明其在token消耗和性能提升方面优于现有方法。

Comments ACL Findings Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14622 2026-04-17 cs.CV

Multigrain-aware Semantic Prototype Scanning and Tri-Token Prompt Learning Embraced High-Order RWKV for Pan-Sharpening

多粒度感知语义原型扫描与三token提示学习融合高阶RWKV用于全分辨率融合

Junfeng Li, Wenyang Zhou, Xueheng Li, Xuanhua He, Jianhou Gan, Wenqi Ren

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Yunnan Normal University, Ministry of Education(云南师范大学教育部) Xidian University(西安电子科技大学) University of Science and Technology of China(中国科学技术大学) The Hong Kong University of Science and Technology(香港理工大学) MoE Key Laboratory of Information Technology(教育部信息科学技术重点实验室)

AI总结 本文提出基于高阶RWKV架构和三token提示机制的多粒度感知语义原型扫描方法,通过语义驱动扫描策略、三token提示学习和可逆Q-Shift操作提升全分辨率融合性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14541 2026-04-17 cs.CV

Giving Faces Their Feelings Back: Explicit Emotion Control for Feedforward Single-Image 3D Head Avatars

赋予面孔情感:面向单图像3D头像的显式情绪控制

Yicheng Gong, Jiawei Zhang, Liqiang Liu, Yanwen Wang, Lei Chu, Jiahao Li, Hao Pan, Hao Zhu, Yan Lu

机构 * Nanjing University(南京大学) Microsoft Research Asia(微软亚洲研究院) University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学)

AI总结 本文提出一种显式情绪控制框架,通过双路径调节机制在不修改核心设计的情况下,将情绪作为独立控制信号注入单图像3D头像重建中,实现情绪与身份的解耦和可控情绪转移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07069 2026-04-17 cs.CV cs.AI

Bird-SR: Bidirectional Reward-Guided Diffusion for Real-World Image Super-Resolution

Bird-SR:双向奖励引导扩散用于现实世界图像超分辨率

Zihao Fan, Xin Lu, Yidi Liu, Jie Huang, Dong Li, Xueyang Fu, Baocai Yin

机构 * MoE Key Laboratory of Brain-inspired Intelligent Perception and Cognition, School of Information Science and Technology, University of Science and Technology of China(脑启发智能感知与认知MoE实验室,信息科学与技术学院,中国科学技术大学) iFlytek Research, iFlytek Co., Ltd., Hefei, China(科大讯飞研究院,科大讯飞股份有限公司,合肥,中国)

AI总结 Bird-SR通过双向奖励引导扩散框架,结合合成和真实图像数据,提升现实世界超分辨率的结构一致性与感知质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14089 2026-04-16 cs.RO cs.AI

UMI-3D: Extending Universal Manipulation Interface from Vision-Limited to 3D Spatial Perception

UMI-3D:从视觉受限到3D空间感知的通用操作接口扩展

Ziming Wang

机构 * HKU(香港大学) USTC(中国科学技术大学)

AI总结 UMI-3D通过集成轻量级低成本LiDAR传感器,提升数据采集的鲁棒性和可扩展性,实现3D空间感知,增强操作任务的性能与可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10164 2026-04-16 cs.AI

Pruning Long Chain-of-Thought of Large Reasoning Models via Small-Scale Preference Optimization

通过小规模偏好优化修剪大推理模型的长推理链

Bin Hong, Jiayu Liu, Kai Zhang, Jianwen Sun, Mengdi Zhang, Zhenya Huang

机构 * State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室) University of Science and Technology of China(中国科学技术大学) Institute of Artificial Intelligence(人工智能研究院) Hefei Comprehensive National Science Center(合肥综合性国家科学中心) Central China Normal University(中部师范大学) Meituan(美团) NeoShell

AI总结 本文提出LCPO方法,通过统一的Bradley-Terry损失框架,有效减少大推理模型的输出长度,同时保持推理性能,实验显示在多个基准上平均输出长度减少超过50%。

Comments 26 pages, 8 figures, ICLR'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13715 2026-04-16 cs.SD cs.AI

Towards Fine-grained Temporal Perception: Post-Training Large Audio-Language Models with Audio-Side Time Prompt

迈向细粒度时间感知:通过音频侧时间提示进行后训练的大音频-语言模型

Yanfeng Shi, Pengfei Cai, Jun Liu, Qing Gu, Nan Jiang, Lirong Dai, Ian McLoughlin, Yan Song

机构 * National Engineering Research Center of Speech and Language Information Processing, University of Science and Technology of China, Hefei, China(语音与语言信息处理国家级工程研究中心,中国科学技术大学,合肥,中国) ICT Cluster, Singapore Institute of Technology, Singapore(新加坡理工学院ICT集群,新加坡)

AI总结 本文提出Audio-Side Time Prompt方法,结合强化学习改进大音频-语言模型的时间感知能力,在音频定位、事件检测等任务中取得显著提升。

Comments Submitted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13694 2026-04-16 cs.AI

Weight Patching: Toward Source-Level Mechanistic Localization in LLMs

权重修补:向LLMs中源级机理定位迈进

Chenghao Sun, Chengsheng Zhang, Guanzheng Qin, Rui Dai, Xinmei Tian

机构 * Key Laboratory of Ministry of Education for Brain Inspired Intelligent Perception and Cognition, University of Science and Technology of China(教育部脑科学与智能感知认知重点实验室,中国科学技术大学)

AI总结 本文提出权重修补方法,通过参数空间干预分析配对同架构模型,揭示指令跟随任务中从浅层候选源侧载体到聚合路由模块再到下游执行电路的层次结构,提升模型融合效果。

Comments 36 pages. Submitted to IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13581 2026-04-16 cs.CV

SocialMirror: Reconstructing 3D Human Interaction Behaviors from Monocular Videos with Semantic and Geometric Guidance

SocialMirror: 从单目视频中利用语义和几何引导重建3D人体交互行为

Qi Xia, Peishan Cong, Ziyi Wang, Yujing Sun, Qin Sun, Xinge Zhu, Mao Ye, Ruigang Yang, Yuexin Ma

机构 * ShanghaiTech University(上海科技大学) Nanyang Technological University(南洋理工大学) Guangzhou Institute of Energy Conversion, CAS(广州能源研究所,中国科学院) University of Science and Technology of China(中国科学技术大学) The Chinese University of Hong Kong(香港中文大学) Inceptio Technology(Inceptio科技) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出SocialMirror框架,通过语义和几何引导解决单目视频中人体重建的挑战,实现高精度交互行为重建,展现强大的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12806 2026-04-15 cs.LG

Interpretable Relational Inference with LLM-Guided Symbolic Dynamics Modeling

基于LLM引导的符号动力学建模的可解释关系推断

Xiaoxiao Liang, Juyuan Zhang, Liming Pan, Linyuan Lü

机构 * School of Cyber Science and Technology, University of Science and Technology of China(中国科学技术大学计算机科学与技术学院)

AI总结 本文提出COSINE框架,通过联合发现交互图和稀疏符号动力学,实现对复杂系统中潜在相互作用结构的可解释推断,实验表明其在合成系统和大规模真实世界数据中的鲁棒性。

Comments Submitted to conference

详情

展开后加载摘要…

URL PDF HTML 收藏