arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Science and Technology of China(中国科学技术大学)

共收录 2210
2606.07647 2026-06-09 cs.CV cs.CL cs.LG 新提交

Steer Where It Matters: Token-Level Visual-Sensitivity Steering for LVLMs Hallucination Mitigation

关键位置引导:基于令牌级视觉敏感度引导的LVLMs幻觉缓解

Ruipeng Zhang, Zhihao Li, C. L. Philip Chen, Tong Zhang

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 提出令牌级视觉敏感度引导(TLVS)方法,通过提取令牌级引导向量并自适应调整引导强度,仅在关键解码步骤抑制幻觉,在多个基准上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07594 2026-06-09 cs.AI cs.HC cs.LG cs.SE 新提交

Syll: Open-Source Personal Automation with Cross-Surface Execution

Syll: 开源个人自动化与跨界面执行

Bo Zhang, Borui Zhang, Chenghao Jiang, Minglei Shi, Xiaofeng Wang, Zheng Zhu, Jie Zhou, Jiwen Lu

机构 * Adobe Systems Inc.(Adobe系统公司) Stardew Valley(《星露谷物语》) macOS University of Science and Technology of China(中国科学技术大学)

AI总结 提出开源多模态智能体框架Syll,通过统一API、CLI和GUI控制,支持用户演示教学和可审计执行,实现跨界面个人自动化。

Comments Code: https://github.com/THU-SAGE/syll

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07542 2026-06-09 cs.CY cs.AI 新提交

DIYHealth Suite: Dataset, Model, and Benchmark for Health Management at Home

DIYHealth Suite:家庭健康管理的数据集、模型与基准

Changshuo Liu, Junran Wu, Zhongle Xie, Wenqiao Zhang, Kaiping Zheng, Jiaqi Zhu, Qingpeng Cai, Ooi Gene Anne, Marcus Chun Jin Tan, Jianwei Yin, James Wei Luen Yip, Beng Chin Ooi

机构 * National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学)

AI总结 针对家庭健康管理中的数据异构、任务多变和缺乏统一基准等问题,提出包含大规模多模态数据集DIYHealth-900K、自适应基础模型DIYHealthGPT(采用混合超低秩适应技术)和首个家庭护理基准DIYHealthBench的综合框架,在11项任务上达到最优性能。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07526 2026-06-09 cs.CL cs.AI 新提交

GraphLoRA: Structure-Aware Low-Rank Adaptation for Large Language Model Recommendation

GraphLoRA: 面向大语言模型推荐的结构感知低秩适配

Lin Mu, Guoji Wang, Li Ni, Lei Sang, Zhize Wu, Peiquan Jin, Yiwen Zhang

机构 * Anhui University(安徽大学) Hefei University(合肥大学) University of Science and Technology of China(中国科学技术大学)

AI总结 提出GraphLoRA框架,通过在低秩适配路径中嵌入可训练的图消息传递网络,实现结构信号传播,从而深度融合图结构与文本语义,提升LLM推荐性能。

Comments ACL 2026 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06407 2026-06-09 cs.CV cs.IR cs.LG eess.IV 版本更新

A Vision-language Framework for Comparative Reasoning in Radiology

放射学中比较推理的视觉语言框架

Tengfei Zhang, Ziheng Zhao, Xiaoman Zhang, Lisong Dai, Pengcheng Qiu, Ya Zhang, Yanfeng Wang, Weidi Xie

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) Department of Biomedical Informatics, Harvard Medical School(哈佛医学院生物医学信息学系) Department of Radiology, Renmin Hospital of Wuhan University(武汉大学仁民医院放射科) Shanghai Sixth People’s Hospital Affiliated to Shanghai Jiao Tong University(上海交通大学附属第六人民医院)

AI总结 提出一个实体感知的跨图像推理框架,通过构建大规模比较影像数据集MedReCo-DB和开发MedReCo及MedReCo-VLM模型,实现了参考病例检索和时间比较解读,显著提升了放射学比较推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03092 2026-06-09 cs.AI 版本更新

The Shadow Price of Reasoning: Economic Perspective on Optimal Budget Allocation for LLMs

推理的影子价格:LLM最优预算分配的经济学视角

Xu Wan, Speed Zhu, Jianwei Cai, Guang Chen, XiMing Huang, Wiggin Zhou, Mingyang Sun

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 本文从经济学视角将推理预算分配建模为全局约束优化问题,提出基于影子价格的CLEAR方法,通过理性放弃和资源再分配,在资源稀缺下显著提升总token成本与平均准确率的帕累托前沿。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30226 2026-06-09 cs.RO cs.AI 版本更新

BORA: Bridging Offline Reinforcement Learning and Online Residual Adaptation for Real-World Dexterous VLA Models

BORA: 弥合离线强化学习与在线残差适应以实现真实世界灵巧VLA模型

Zhongxi Chen, Yifan Han, Yanming Shao, Huanming Liu, Congsheng Xu, Xiaoyu Chen, Yao Mu, Wenzhao Lian

机构 * Shanghai Jiao Tong University(上海交通大学) CASIA(中国科学院自动化研究所) Shanghai AI Laboratory(上海人工智能实验室) USTC(中国科学技术大学)

AI总结 提出BORA框架,通过离线构建动作条件价值引导的评论家,并结合在线冻结VLA基础、引入人类在环的分块残差适应机制,解决灵巧操作中高维探索导致的时间不一致、样本低效和硬件风险问题,在五个真实灵巧任务上平均成功率提升33%。

Comments 24 pages,11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28831 2026-06-09 cs.CL cs.AI 版本更新

S3Mem: Structured Spatiotemporal Scene-Event Memory for Long-Horizon Interactive Question Answering

S3Mem:用于长时域交互式问答的结构化时空场景-事件记忆

Encheng Su, Jianyu Wu, Jinouwen Zhang, Qiucheng Yu, Chen Tang, Pengze Li, Lintao Wang, Aoran Wang, Xinzhu Ma, Shixiang Tang, Yizhou Wang, Houqiang Li

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) City University of Hong Kong(香港城市大学) The Chinese University of Hong Kong(香港中文大学) Fudan University(复旦大学) The University of Sydney(悉尼大学) Beihang University(北航)

AI总结 提出S3MEM框架,通过结构化场景-事件记忆和锚点敏感检索,在长时域交互式问答中实现比通用记忆接口更优的准确率-效率平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19674 2026-06-09 cs.AI 版本更新

Beyond Rational Illusion: Behaviorally Realistic Strategic Classification

超越理性错觉:行为现实的战略分类

Xinpeng Lv, Yunxin Mao, Renzhe Xu, Chunyuan Zheng, Yikai Chen, Haoxuan Li, Yang Shi, Jinxuan Yang, Zhouchen Lin, Yuanlong Chen, Yuanxing Zhang, Shaowu Yang, Wenjing Yang, Haotian Wang

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 本文提出了一种基于前景理论的行为现实战略分类框架,以应对现实中受心理偏差影响的决策者策略性操纵问题。

Comments Accepted by ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19662 2026-06-09 cs.AI 版本更新

When Tabular Foundation Models Meet Strategic Tabular Data: A Prior Alignment Approach

当表格基础模型遇见策略性表格数据:一种先验对齐方法

Xinpeng Lv, Yunxin Mao, Renzhe Xu, Chunyuan Zheng, Yikai Chen, Haoxuan Li, Jinxuan Yang, Kun Kuang, Yuanlong Chen, Mingyang Geng, Wanrong Huang, Shixuan Liu, Shaowu Yang, Wenjing Yang, Zhouchen Lin, Haotian Wang

机构 * University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学)

AI总结 本文研究了表格基础模型在策略性表格数据上的泛化能力,提出了一种策略感知的先验对齐框架SPN,以提高模型在策略性环境中的鲁棒性和预测性能。

Comments Accepted by ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19228 2026-06-09 cs.CL cs.AI cs.IT cs.LG math.IT 版本更新

Diagnosing Multi-step Reasoning Failures in Black-box LLMs via Stepwise Confidence Attribution

通过分步置信度归因诊断黑盒大语言模型的多步推理失败

Xiaoou Liu, Tiejin Chen, Dengjia Zhang, Yaqing Wang, Lu Cheng, Hua Wei

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 本文提出了一种基于分步置信度归因(SCA)的方法,用于诊断黑盒大语言模型在多步推理中的失败,通过信息瓶颈原理对生成的推理轨迹进行置信度评估,并通过实验验证该方法在数学推理和多跳问答任务中的有效性。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14531 2026-06-09 cs.CL 版本更新

Language Generation as Optimal Control: Closed-Loop Diffusion in Latent Control Space

语言生成作为最优控制:潜在控制空间中的闭环扩散

ZiYi Dong, Yuliang Huang, Weijian Deng, Xiangyang Ji, Liang Lin, Pengxu Wei

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 本文将语言生成重新表述为随机最优控制问题,通过统一理论视角分析自回归和扩散模型,解释其局限性,并提出基于流匹配的闭环控制器实现高效文本生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11484 2026-06-09 cs.AI 版本更新

Engagement Process: Rethinking the Temporal Interface of Action and Observation

参与过程:重新思考动作与观察的时间接口

Jialian Li, Yuchen Cao, Junhong Liu, Weiran Guo, Xutao Wang, Jiaming Song, Jiahao Zhang, Jie Chen

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 本文提出参与过程(EP)模型,通过显式时间接口处理动作与观察的不同时间尺度交互,支持多速率协调和子系统组合,揭示隐藏的时间行为并使策略适应显式时间成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22097 2026-06-09 cs.SE cs.AI cs.CL cs.CR 版本更新

SecureVibeBench: Benchmarking Secure Vibe Coding of AI Agents via Reconstructing Vulnerability-Introducing Scenarios

SecureVibeBench: 通过重建引入漏洞的场景来基准测试AI代理的安全振动编码

Junkai Chen, Huihui Huang, Yunbo Lyu, Junwen An, Jieke Shi, Chengran Yang, Ting Zhang, Haoye Tian, Yikun Li, Zhenhao Li, Xin Zhou, Xing Hu, David Lo

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 本文提出SecureVibeBench,一个包含105个C/C++安全编码任务的基准测试,旨在评估AI代理在真实场景中生成安全代码的能力,发现现有方法在评估人类与AI代理对比时的不足。

Comments ACL 2026 Main Conference. Our code and data are on https://github.com/iCSawyer/SecureVibeBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13869 2026-06-09 cs.CV 版本更新

Coarse-to-Fine Hierarchical Alignment for UAV-based Human Detection using Diffusion Models

基于扩散模型的UAV人类检测粗到细层次对齐

Wenda Li, Meng Wu, Liangzhao Chen, Sungmin Eum, Heesung Kwon, Qing Qu

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 本文提出Coarse-to-Fine Hierarchical Alignment框架,通过合成数据转换缩小领域差距,提升UAV人类检测精度,实验显示mAP50提升14.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10395 2026-06-09 cs.LG 版本更新

Graph-GRPO: Training Graph Flow Models with Reinforcement Learning

图流模型:基于强化学习训练图流模型

Baoheng Zhu, Deyu Bo, Delvin Ce Zhang, Xiao Wang

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 本文提出Graph-GRPO框架,通过可验证奖励训练图流模型,推导了转移概率表达式并提出局部探索策略,实验显示其在生成质量与分子优化任务中表现优异。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22766 2026-06-09 cs.CL 版本更新

Imagination Helps Visual Reasoning, But Not Yet in Latent Space

想象力有助于视觉推理,但尚未在潜在空间中实现

You Li, Chi Chen, Yanghao Li, Fanhu Zeng, Kaiyu Huang, Jinan Xu, Maosong Sun

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 通过因果中介分析发现,多模态大语言模型中的潜在推理存在输入-潜在和潜在-答案两个关键断连,表明其有效性有限,并提出显式想象方法CapImagine,在视觉推理任务中表现更优。

Comments ICML 2026 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17245 2026-06-09 cs.AI 版本更新

Web Agents Should Use Typed Actions Instead of Click-Based Browsing

Web 智能体应使用类型化动作而非基于点击的浏览

Linxi Jiang, Rui Xi, Zhijie Liu, Shuo Chen, Zhiqiang Lin, Suman Nath

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 本文提出通过语义层支持的类型化动作(web verbs)替代低层交互原语,以构建可靠、可审计的Web智能体,并通过案例展示其优势。

Comments Accepted to the ICML 2026 Position Paper Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12996 2026-06-09 cs.CL cs.AI 版本更新

Know More, Know Clearer: A Meta-Cognitive Framework for Knowledge Augmentation in Large Language Models

知道更多,更清晰:大型语言模型中知识增强的元认知框架

Hao Chen, Ye He, Yuchun Fan, Yukun Yan, Zhenghao Liu, Qingfu Zhu, Maosong Sun, Wanxiang Che

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 提出元认知框架,利用内部认知信号划分知识空间为掌握、混淆和缺失区域,通过差异化干预和认知一致性机制增强知识并校准置信度,实验证明优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21754 2026-06-09 cs.AI 版本更新

Language-based Trial and Error Falls Behind in the Era of Experience

基于语言的试错在经验时代落后了

Haoyu Wang, Guozheng Ma, Shugang Cui, Yilun Kong, Haotian Luo, Li Shen, Mengya Gao, Yichao Wu, Xiaogang Wang, Dacheng Tao

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 针对LLM在非语言环境中探索成本高的问题,提出SCOUT框架,用轻量级模型探索环境,通过SFT和RL激活LLM的世界知识,显著提升性能并降低计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02014 2026-06-09 cs.LG 版本更新

Normality Calibration in Semi-supervised Graph Anomaly Detection

半监督图异常检测中的正态性校准

Guolei Zeng, Hezhe Qiao, Guoguo Ai, Jinsong Guo, Guansong Pang

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 提出GraphNC框架,通过教师模型在异常分数和表示空间联合校准正态性,解决半监督图异常检测中正态性过拟合问题,降低误报。

Comments Accepted by ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21996 2026-06-09 cs.CL cs.AI cs.LG 版本更新

Mechanistic Data Attribution: Tracing the Training Origins of Interpretable LLM Units

机械论数据归因:追踪可解释LLM单元的训练起源

Jianhui Chen, Yuzhang Luo, Liangming Pan

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 提出机械论数据归因(MDA)框架,利用影响函数将可解释单元追溯到特定训练样本,通过因果验证表明干预高影响样本可显著调节可解释头的涌现,并发现重复结构数据作为机械催化剂,同时验证了归纳头与上下文学习之间的功能联系。

Comments ICML2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18510 2026-06-09 cs.LG cs.AI 版本更新

Just-In-Time Reinforcement Learning: Continual Learning in LLM Agents Without Gradient Updates

即时强化学习:无需梯度更新的LLM智能体持续学习

Yibo Li, Zijie Lin, Ailin Deng, Xuan Zhang, Yufei He, Shuo Ji, Tri Cao, Bryan Hooi

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 提出JitRL框架,通过动态非参数记忆和即时优势估计,无需梯度更新即可实现LLM智能体的测试时策略优化,在WebArena和Jericho上达到训练无关方法最优,且性能超越微调方法,成本降低30倍以上。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14229 2026-06-09 cs.AI cs.CV cs.RO 版本更新

HA-VLN 2.0: An Open Benchmark and Leaderboard for Human-Aware Navigation in Discrete and Continuous Environments with Dynamic Multi-Human Interactions

HA-VLN 2.0:面向离散与连续环境中动态多人交互的人类感知导航开放基准与排行榜

Yifei Dong, Fengyi Wu, Qi He, Lingdong Kong, Heng Li, Minghan Li, Zebang Cheng, Yuxuan Zhou, Jingdong Sun, Qi Dai, Alexander G Hauptmann, Zhi-Qi Cheng

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 提出HA-VLN 2.0统一基准,通过标准化任务、HAPS 2.0数据集与模拟器、16844条社会指令基准测试及真实机器人实验,证明显式社会建模提升导航鲁棒性并减少碰撞。

Comments 35 pages, 20 figures, website: https://f1y1113.github.io/HA-VLN-webpage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24531 2026-06-09 cs.CV 版本更新

Diffusion Bridge or Flow Matching? A Unifying Framework and Comparative Analysis

扩散桥还是流匹配?一个统一框架与比较分析

Kaizhen Zhu, Mokai Pan, Zhechuan Yu, Jingya Wang, Jingyi Yu, Ye Shi

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 本文通过随机最优控制和最优传输理论统一了扩散桥与流匹配,证明扩散桥成本更低且轨迹更稳定,并在图像恢复等任务中通过实验验证了理论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02606 2026-06-09 cs.SD cs.AI cs.CR cs.LG eess.AS

De-AntiFake: Rethinking the Protective Perturbations Against Voice Cloning Attacks

De-AntiFake:重新思考对抗语音克隆攻击的保护扰动

Wei Fan, Kejiang Chen, Chang Liu, Weiming Zhang, Nenghai Yu

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 本文提出一种两阶段净化方法,旨在提升对抗语音克隆攻击的防御效果,通过净化扰动语音并利用音素指导进行优化,实验表明其优于现有方法。

Comments Accepted by ICML 2025

Journal ref Proceedings of the 42nd International Conference on Machine Learning, PMLR 267, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21239 2026-06-09 cs.CL 版本更新

A Unified LLM-Adaptable Framework for Cold-Start Cognitive Diagnosis

面向冷启动认知诊断的统一LLM可适配框架

Zihan Yao, Chentao Song, Yu He, Tianyu Qi, Jian Zhang, Weiping Fu, Jun Liu

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 提出LMCD框架,通过知识扩散和语义-认知融合两阶段,利用大语言模型增强冷启动场景下的认知诊断性能。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.12421 2026-06-09 cs.LG cs.AI q-bio.QM

Tackling Small Sample Survival Analysis via Transfer Learning: A Study of Colorectal Cancer Prognosis

通过迁移学习解决小样本生存分析:结直肠癌预后的研究

Yonghao Zhao, Changtao Li, Chi Shu, Qingbin Wu, Hong Li, Chuan Xu, Tianrui Li, Ziqiang Wang, Zhipeng Luo, Yazhou He

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 本文通过迁移学习提升小样本生存分析,针对结直肠癌预后,改进了多种生存模型,如DeepSurv、Cox-CC、DeepHit和Random Survival Forest,实验结果显示迁移学习显著提升了模型性能。

Journal ref Artificial Intelligence in Medicine, 178:103426, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.21747 2026-06-09 cs.CV 版本更新

MotionGPT-2: A General-Purpose Motion-Language Model for Motion Generation and Understanding

MotionGPT-2:用于运动生成与理解的通用运动-语言模型

Yuan Wang, Di Huang, Yaqi Zhang, Wanli Ouyang, Jile Jiao, Xuetao Feng, Dan Xu, Shixiang Tang

机构 * Tsinghua University(清华大学) The University of Sydney(悉尼大学) University of Science and Technology of China(中国科学技术大学) The Chinese University of Hong Kong(香港中文大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Intime Department Store(Intime百货) Deepeleph HKUST(香港科技大学)

AI总结 提出MotionGPT-2,一种统一的大规模运动-语言模型,通过预训练大语言模型支持多模态控制条件,实现运动生成、描述和补全等多种任务,并引入Part-Aware VQVAE实现细粒度身体和手部运动表示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.06013 2026-06-09 cs.LG cs.CV 版本更新

Are Classification Robustness and Explanation Robustness Really Strongly Correlated? An Analysis Through Input Loss Landscape

分类鲁棒性与解释鲁棒性真的强相关吗?基于输入损失景观的分析

Tiejin Chen, Wenwang Huang, Linsey Pang, Dongsheng Luo, Hua Wei

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 本文质疑分类鲁棒性与解释鲁棒性强相关的传统观点,通过聚类评估解释鲁棒性,并提出调整解释损失景观的训练方法,发现两者并不强相关。

详情

展开后加载摘要…

URL PDF HTML 收藏