arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

University of Science and Technology of China(中国科学技术大学)

2026-03-10 至 2026-03-10 共收录 12
2603.08113 2026-03-10 cs.CV

SAMoE-VLA: A Scene Adaptive Mixture-of-Experts Vision-Language-Action Model for Autonomous Driving

SAMoE-VLA:一种面向自动驾驶的场景自适应混合专家视觉-语言-动作模型

Zihan You, Hongwei Liu, Chenxu Dang, Zhe Wang, Sining Ang, Aoqi Wang, Yan Wang

机构 * Institute for AI Industry Research (AIR), Tsinghua University(人工智能产业研究院(AIR),清华大学) School of Instrument Science and Engineering, Southeast University(仪器科学与工程学院,东南大学) Zhili College, Tsinghua University(紫荆学院,清华大学) School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(人工智能与自动化学院,华中科技大学) Department of Automation, University of Science and Technology of China(自动化学院,中国科学技术大学) Department of Automation, University of Science and Technology Beijing(自动化学院,北京科技大学)

AI总结 SAMoE-VLA通过场景自适应混合专家机制提升自动驾驶中的视觉-语言-动作推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08035 2026-03-10 cs.AI cs.LG

CDRRM: Contrast-Driven Rubric Generation for Reliable and Interpretable Reward Modeling

CDRRM:基于对比的评分标准生成用于可靠和可解释的奖励建模

Dengcan Liu, Fengkai Yang, Xiaohan Wang, Shurui Yan, Jiajun Chai, Jiahao Li, Yikun Ban, Zhendong Mao, Wei Lin, Guojun Yin

机构 * University of Science and Technology of China(科学技术大学) Peking University(北京大学) BeiHang University(北航大学)

AI总结 CDRRM通过对比驱动的评分标准生成方法,实现可靠且可解释的奖励建模,有效缓解评估偏见并提升数据效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08034 2026-03-10 cs.CV cs.AI

Solution to the 10th ABAW Expression Recognition Challenge: A Robust Multimodal Framework with Safe Cross-Attention and Modality Dropout

解决第10届ABAW表情识别挑战的方案:一种具有安全交叉注意力和模态dropout的鲁棒多模态框架

Jun Yu, Naixiang Zheng, Guoyuan Wang, Yunxiang Zhang, Lingsi Zhu, Jiaen Liang, Wei Huang, Shengping Liu

机构 * University of Science and Technology of China(中国科学技术大学) Unisound AI Technology Co., Ltd.(Unisound人工智能技术有限公司)

AI总结 本文提出一种鲁棒多模态框架,通过安全交叉注意力和模态dropout处理现实环境中的遮挡和缺失模态问题,提升情绪识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07897 2026-03-10 cs.LG

LeJOT-AutoML: LLM-Driven Feature Engineering for Job Execution Time Prediction in Databricks Cost Optimization

LeJOT-AutoML:基于LLM的特征工程用于Databricks成本优化中的作业执行时间预测

Lizhi Ma, Yi-Xiang Hu, Yihui Ren, Feng Wu, Xiang-Yang Li

机构 * University of Science and Technology of China(中国科学技术大学) Lenovo(联想)

AI总结 LeJOT-AutoML利用LLM驱动的AutoML框架,通过动态生成特征提升Databricks作业执行时间预测的准确性,从而实现成本优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07671 2026-03-10 cs.LG

Beyond Surrogates: A Quantitative Analysis for Inter-Metric Relationships

超越替代方案:跨度量关系的定量分析

Yuanhao Pu, Defu Lian, Enhong Chen

机构 * School of Artificial Intelligence & Data Science, University of Science and Technology of China(人工智能与数据科学学院,中国科学技术大学) School of Computer Science & Technology, University of Science and Technology of China(计算机科学与技术学院,中国科学技术大学) State Key Laboratory of Cognitive Intelligence, China(认知智能国家重点实验室,中国)

AI总结 本文提出统一理论框架,定量分析指标间关系,解决指标不匹配问题,确保离线改进与在线目标一致。

Comments 18 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07365 2026-03-10 cs.SD cs.AI cs.CL cs.MM eess.AS

Multi-Domain Audio Question Answering Benchmark Toward Acoustic Content Reasoning

多领域音频问答基准:面向声音内容推理

Chao-Han Huck Yang, Sreyan Ghosh, Qing Wang, Jaeyeon Kim, Hengyi Hong, Sonal Kumar, Guirui Zhong, Zhifeng Kong, S Sakshi, Vaibhavi Lokegaonkar, Oriol Nieto, Ramani Duraiswami, Dinesh Manocha, Gunhee Kim, Jun Du, Rafael Valle, Bryan Catanzaro

机构 * NVIDIA University of Maryland, College Park(马里兰大学 College Park 分校) University of Science and Technology of China(中国科学技术大学) Seoul National University(首尔国立大学) Adobe

AI总结 DCASE 2025挑战赛提出多领域音频问答基准,通过生物声学、时间声音景观和复杂问答子集测试音频-语言模型在多样声音场景中的交互式问答能力,推动音频理解和推理能力发展。

Comments Dataset: https://huggingface.co/datasets/PeacefulData/2025_DCASE_AudioQA_Official DCASE Task-5 challenge: dcase.community/challenge2025/task-audio-question-answering. Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.11093 2026-03-10 quant-ph cs.LG

Simulating Non-Markovian Open Quantum Dynamics with Neural Quantum States

用神经量子态模拟非马尔可夫开放量子动力学

Long Cao, Liwei Ge, Daochi Zhang, Xiang Li, Yao Wang, Rui-Xue Xu, YiJing Yan, Xiao Zheng

机构 * Hefei National Research Center for Physical Sciences at the Microscale, University of Science and Technology of China(合肥微尺度物质科学国家研究中心,中国科学技术大学) Department of Chemistry, Fudan University(复旦大学化学系) Hefei National Laboratory(合肥国家实验室)

AI总结 本文提出一种基于神经量子态和耗散子嵌入量子主方程的方法,用于高效模拟非马尔可夫开放量子动力学,提升计算可扩展性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07107 2026-03-10 cs.IR cs.AI

Efficient Personalized Reranking with Semi-Autoregressive Generation and Online Knowledge Distillation

高效个性化重排序:半自动生成与在线知识蒸馏

Kai Cheng, Hao Wang, Wei Guo, Weiwen Liu, Yong Liu, Yawen Li, Enhong Chen

机构 * University of Science and Technology of China(中国科学技术大学) Huawei(华为) Shanghai Jiao Tong University(上海交通大学) Beijing University of Posts and Telecommunications(北京邮电大学)

AI总结 本文提出PSAD框架,通过半自动生成与在线知识蒸馏提升个性化重排序的效率和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07078 2026-03-10 cs.AI cs.CL

CoTJudger: A Graph-Driven Framework for Automatic Evaluation of Chain-of-Thought Efficiency and Redundancy in LRMs

CoTJudger: 一种基于图的框架,用于自动评估链式推理效率和冗余性在LRMs中

Siyi Li, Jiajun Shi, Shiwen Ni, Ge Zhang, Shuaimin Li, Shijian Wang, Zhoufutu Wen, Yizhi Li, Hamid Alinejad-Rokny, Jiaheng Liu, Min Yang, Wenhao Huang

机构 * University of Science and Technology of China(科学技术大学) Shenzhen University of Advanced Technology(深圳先进技术大学) Shenzhen Institutes of Advanced Technology, CAS(深圳先进技术研究所,中国科学院) Southeast University(东南大学) Nanjing University(南京大学) Beihang University(北航) University of Manchester(曼彻斯特大学)

AI总结 CoTJudger通过构建依赖图提取最短有效路径,评估链式推理的效率与冗余,揭示模型中的冗余问题及失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13695 2026-03-10 cs.AI math.AC math.CO math.CT

Can a Lightweight Automated AI Pipeline Solve Research-Level Mathematical Problems?

能否一个轻量级的自动化AI流水线解决研究级别的数学问题?

Lve Meng, Weilong Zhao, Yanzhi Zhang, Haoxiang Guan, Jiyan He

机构 * University of Science and Technology of China(中国科学技术大学) Université Paris Cité(巴黎cité大学) Zhongguancun Academy(中关村学院)

AI总结 本研究展示了一种轻量级自动化AI流水线,能够解决复杂的研究级数学问题,并通过验证和开源实现。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09486 2026-03-10 cs.CV cs.AI cs.MM

Video-EM: Event-Centric Episodic Memory for Long-Form Video Understanding

视频-EM:面向长视频理解的事件中心型片段记忆

Yun Wang, Long Zhang, Jingren Liu, Jiaqi Yan, Zhanjie Zhang, Jiahao Zheng, Ao Ma, Run Ling, Xun Yang, Dapeng Wu, Xiangyu Chen, Xuelong Li

机构 * City University of Hong Kong(香港城市大学) University of Science and Technology of China(中国科学技术大学) Tianjin University(天津大学) Nanjing University(南京大学) Zhejiang University(浙江大学) The Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究所(TeleAI))

AI总结 Video-EM通过事件中心型片段记忆框架,将长视频问答转化为事件构建与记忆细化,提升长视频理解的连贯性与可靠性。

Comments 14 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13347 2026-03-10 cs.CV

$π^3$: Permutation-Equivariant Visual Geometry Learning

π³:排列等变视觉几何学习

Yifan Wang, Jianjun Zhou, Haoyi Zhu, Wenzheng Chang, Yang Zhou, Zizun Li, Junyi Chen, Jiangmiao Pang, Chunhua Shen, Tong He

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院) Zhejiang University(浙江大学) University of Science and Technology of China(中国科学技术大学) Fudan University(复旦大学)

AI总结 π³通过排列等变架构实现无需参考视角的视觉几何重建,提升相机姿态和点地图重建的准确性和鲁棒性。

Comments Project page: https://yyfz.github.io/pi3/

详情

展开后加载摘要…

URL PDF HTML 收藏