arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Science and Technology of China(中国科学技术大学)

共收录 2210
2104.12183 2026-06-09 cs.RO 版本更新

An Interval Branch-and-Bound-Based Inverse Kinemetics Algorithm Towards Global Optimal Redundancy Resolution

基于区间分支定界的逆运动学算法实现全局最优冗余度解析

Yajue Yang, Zeqing Zhang, Yuanqing Wu, Jia Pan

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 提出一种结合快速数值IK求解器搜索启发式的区间分支定界方法,高效求解机械臂广义逆运动学问题,生成邻域解以提供自运动流形的丰富几何信息,支持最优规划和任意时间求解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07513 2026-06-08 cs.CL 新提交

Agentopia: Long-Term Life Simulation and Learning in Agent Societies

Agentopia: 智能体社会中的长期生活模拟与学习

Xintao Wang, Sirui Zheng, Hongqiu Wu, Weiyuan Li, Jen-tse Huang, Minghao Zhu, Can Zu, Qi Deng, Jiawei Wang, Qianyu He, Heng Wang, Xiaojian Wu, Yunzhe Tao

机构 * Fudan University(复旦大学) Johns Hopkins University(约翰霍普金斯大学) University of Science and Technology of China(中国科学技术大学)

AI总结 提出Agentopia框架,模拟100个智能体在10年内的社会生活,通过生命奖励训练LLM,提升其社交智能,并在角色扮演基准上取得15.6%的提升。

Comments 79 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07367 2026-06-08 cs.LG 新提交

Self-evolving LLM agents with in-distribution Optimization

自演化分布内优化的LLM智能体

Yudi Zhang, Meng Fang, Zhenfang Chen, Mykola Pechenizkiy

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 提出Q-Evolve框架,通过分布内强化学习统一过程奖励标注与策略学习,利用加权隐式Q学习稳定贝尔曼更新,实现智能体自演化,在AlfWorld等任务上优于基线。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07345 2026-06-08 cs.LG 新提交

TabSwift: An Efficient Tabular Foundation Model with Row-Wise Attention

TabSwift: 一种高效的基于行注意力的表格基础模型

Si-Yang Liu, Han-Jia Ye

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 提出TabSwift,通过门控注意力稳定和可学习注册令牌增强轻量级行注意力骨干,实现高效表格上下文学习,在保持竞争力的同时降低推理成本。

Comments Accepted to ICML 2026, spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07288 2026-06-08 cs.CV cs.GR 新提交

ExMesh: EXplicit Mesh Reconstruction with Topology Adaptation

ExMesh: 具有拓扑自适应的显式网格重建

Chuanjin Fan, Lifan Wu, Wenjie Chang, Hanzhi Chang, Wenfei Yang, Tianzhu Zhang

机构 * University of Science and Technology of China(中国科学技术大学) National Key Laboratory of Deep Space Exploration, Deep Space Exploration Laboratory(国家空间科学探测重点实验室,深空探测实验室)

AI总结 提出ExMesh框架,通过可微优化与离散拓扑更新直接优化显式网格,引入自适应顶点分裂合并和实时UV维护,实现从粗到细的优化,兼顾精度、效率和网格简洁性。

Comments Accepted at the IEEE/CVF Conference on Computer Vision and Pattern Recognition 2026 (CVPR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07186 2026-06-08 cs.RO cs.SE 新提交

A Causal Probabilistic Framework for Perception-Informed Closed-Loop Simulation of Autonomous Driving

面向感知信息闭环仿真的自动驾驶因果概率框架

Zhennan Fei, Rickard Johansson, Mikael Andersson, Matthias Eng, Mattias Eriksson, Kaveh Kianfar, Sadegh Rahrovani, Chris van der Ploeg, Michael Borth, Maren Buermann, Michiel Braat, Henk Goossens, Zijian Han, Majid Khorsand Vakilzadeh, Gabriel Rodrigues de Campos

机构 * ETH Zürich(苏黎世联邦理工学院) KTH Royal Institute of Technology(皇家理工学院) University of Science and Technology of China(中国科学技术大学)

AI总结 提出一种因果概率模型框架,将感知误差注入标准仿真环境,揭示理想SIL无法捕获的潜在风险,为SOTIF验证提供可扩展路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07034 2026-06-08 cs.CV 新提交

ForensicConcept: Transferable Forensic Concepts for AIGI Detection

ForensicConcept: 用于AIGI检测的可迁移取证概念

Menyanshu Zhou, Ziyin Zhou, Ke Sun, Yunpeng Luo, Jiayi Ji, Xiaoshuai Sun, Rongrong Ji

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 提出ForensicConcept框架,通过Transformer归因定位关键补丁、构建概念码本并利用扩散特征对齐,实现AI生成图像检测中可迁移取证概念的提取与跨骨干网络迁移。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07032 2026-06-08 cs.CV cs.AI 新提交

Never Seen Before: Benchmarking Genuine Zero-Shot Composed Image Retrieval with Consistent Video-Sourced Datasets

前所未见:基于一致视频源数据集的真正零样本组合图像检索基准测试

Zhenyu Yang, Zemin Du, Shengsheng Qian, Changsheng Xu

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 针对现有零样本组合图像检索数据集存在参考与目标图像不相关、非真正零样本的问题,提出ZeroSight基准,包含来自视频的一致参考-目标对和训练无关的MLLM驱动方法SC4CIR,通过三重对称一致性检查识别难负样本,实验表明现有方法性能被高估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06991 2026-06-08 cs.CV cs.AI 新提交

Don't Pause: Streaming Video-Language Synchrony for Online Video Understanding

不要暂停:面向在线视频理解的流式视频-语言同步

Zhenyu Yang, Kairui Zhang, Shengsheng Qian, Weiming Dong, Changsheng Xu

机构 * National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学)

AI总结 提出流式视频-语言同步(SVLS)范式,通过帧驱动转换控制器和流式令牌调节器实现视频帧与语言生成的细粒度同步,在不中断感知的情况下进行实时交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06892 2026-06-08 cs.LG 新提交

GRASP: Geometry-aware Residual Alignment for Scalable Pretraining Data Attribution

GRASP:面向可扩展预训练数据归因的几何感知残差对齐

Yue Min, Ruining Chen, Yujun Li

机构 * Wizard Quant University of Science and Technology of China(中国科学技术大学)

AI总结 提出GRASP方法,通过二次几何惩罚建模子集交互,结合低维特征草图与有限置信度选择协议,实现可扩展的预训练数据归因,显著提升反事实子集保真度并降低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06885 2026-06-08 cs.CV cs.AI 新提交

FreeAnimate: Training-Free Human Image Animation with Preview-Guided Denoising

FreeAnimate: 基于预览引导去噪的无训练人体图像动画

Yuan Zeng, Yujia Shi, Zongqing Lu, QingMin Liao

机构 * National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学)

AI总结 提出FreeAnimate框架,利用图像扩散模型内在能力实现无训练的人体图像动画,通过预览生成策略提供时序和结构先验,结合反演增强注意力和参考锚定自注意力模块,保证时序一致性和身份保持。

Comments Accepted to IEEE ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06875 2026-06-08 cs.CV cs.CR 新提交

Unified Safe In-context Image Generation in Multimodal Diffusion Transformers via Restricting Unsafe Information Flows

统一安全上下文图像生成:在多模态扩散变换器中通过限制不安全信息流

Xiang Yang, Feifei Li, Mi Zhang, Geng Hong, Xiaoyu You, Mi Wen, Min Yang

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 提出UVR框架,通过分析注意力动态中的不安全信息流,在无需训练的情况下对输出补丁进行注意力调制,实现图像生成和编辑任务的安全控制,达到91%和77%的擦除率。

Comments ICML26

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06872 2026-06-08 cs.CV cs.AI 新提交

EgoPressDiff: Multimodal Video Diffusion for Egocentric UV-Domain Hand-Pressure Estimation

EgoPressDiff: 用于自我中心UV域手部压力估计的多模态视频扩散模型

Yuan Zeng, Zilue Gao, Yujia Shi, Zongqing Lu, Wenming Yang, QingMin Liao

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 提出EgoPressDiff,一种条件视频扩散框架,通过多模态条件策略(手部姿态、3D网格顶点和深度信息)从视觉输入生成UV压力图,解决了现有方法中的量化误差和时间不一致问题,在EgoPressure数据集上实现SOTA,Volumetric IoU相对提升34%以上。

Comments Accepted to IEEE ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06856 2026-06-08 cs.CV 新提交

FS-DVS: A Frequency-Selective Dynamic Visual Sensing Paradigm for Enhancing Information Completeness

FS-DVS:一种增强信息完整性的频率选择性动态视觉传感范式

Feiyu Ji, Xiaokang Yang, Xiaoyun Yuan

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 提出FS-DVS范式,通过在事件触发前集成可学习空间滤波器模拟视网膜神经节细胞聚合机制,自发学习中心-环绕模式以增强中频信息,在目标检测和动作识别中取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06828 2026-06-08 cs.CV cs.LG 新提交

AdaGRPO: A Capability-Aware Adaptive Enhancement for Flow-based GRPO

AdaGRPO: 一种面向基于流的GRPO的能力感知自适应增强方法

Jiazi Bu, Pengyang Ling, Yujie Zhou, Yibin Wang, Yuhang Zang, Tianyi Wei, Xiaohang Zhan, Jiaqi Wang, Tong Wu, Xingang Pan, Dahua Lin

机构 * Shanghai Jiao Tong University(上海交通大学) S-Lab, Nanyang Technological University(南洋理工大学S实验室) Shanghai AI Laboratory(上海人工智能实验室) University of Science and Technology of China(中国科学技术大学) Stanford University(斯坦福大学) Shanghai Innovation Institute(上海创新研究院) The Chinese University of Hong Kong(香港中文大学) Fudan University(复旦大学) CPII under InnoHK(InnoHK下的CPII) Adobe Research(Adobe研究)

AI总结 提出AdaGRPO,通过在线课程过滤策略和跨层级优势融合,解决流模型GRPO中提示选择随机和优势估计缺乏全局视角的问题,提升训练稳定性和性能。

Comments Project Website: https://bujiazi.github.io/adagrpo.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06664 2026-06-08 cs.CV cs.AI cs.LG 新提交

Inside the Visual Mind: Neuroscience-Motivated Concept Circuits for Interpreting and Steering Vision Transformers

内在视觉:神经科学启发的概念电路用于解释和引导视觉变换器

Tang Li, Yanlin Chen, Mengmeng Ma, Xi Peng

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 提出ViSAE工具箱,通过神经科学启发的概念电路解释视觉变换器内部机制,包含高效概念集、自动电路追踪算法和概念编辑应用,在WaterBirds上最差组准确率提升48.2%。

Comments In Proceedings of the International Conference on Machine Learning, 2026. (acceptance rate 26.6%)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06536 2026-06-08 cs.CV cs.AI cs.LG 新提交

Attention-Guided Autoencoder Fusion for Insulator Defect Detection Using UAV Transmission-Line Imaging

基于注意力引导自编码器融合的无人机输电线路绝缘子缺陷检测

Malak Allam, Khaled Shaban, Ali Hamdi

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 提出AE-YOLO框架,通过注意力引导自编码器融合与方差最大化正则化,解决无人机图像中绝缘子缺陷检测的类别不平衡和尺度变化问题,在mAP@0.5上达95.10%,优于YOLO基线5个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06518 2026-06-08 cs.AI cs.LG 新提交

DiBS: Diffusion-Informed Branch Selection

DiBS: 扩散模型引导的分支选择

Bo Liu, Yuan Xie, Yuan Gao, Xiaolong Luo, Peng Ye, Tao Chen, Fujun Han

机构 * Nanyang Technological University(南洋理工大学) University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学)

AI总结 针对数独求解中学习型求解器缺乏正确性保证而符号求解器存在长尾搜索的问题,提出扩散模型引导的分支选择方法DiBS,在保持符号求解器完备性的同时,利用扩散模型排序候选值,显著降低搜索成本。

Comments 12 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05949 2026-06-08 cs.CV 版本更新

Faithful, Enriched, and Precise: Benchmarking Natural-Science Illustration Generation by T2I models

忠实、丰富且精确:T2I模型在自然科学插图生成中的基准测试

Yifan Chang, Jiaxin Ai, Jianwen Sun, Yuandong Pu, Siqi Luo, Liangliang Zhao, Yuchen Ren, Minghao Liu, Yunfei Yu, Yu Qiao, Kaipeng Zhang, Yihao Liu

机构 * Shanghai Innovation Institute(上海创新研究院) Shanghai AI Laboratory(上海人工智能实验室) University of Science and Technology of China(中国科学技术大学) Wuhan University(武汉大学) Nankai University(南开大学) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) ZODA Alaya Studio(Alaya工作室)

AI总结 提出FEPBench基准,通过细粒度原子集标注和三维评估(指令忠实性、推理丰富性、语义精确性)系统评估T2I模型在自然科学插图生成中的表现,发现即使最先进的闭源模型仍存在文本渲染瓶颈、推理丰富性有限以及生成丰富性与精确性难以平衡的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04373 2026-06-08 cs.CV cs.AI 版本更新

Selective Coupling of Decoupled Informative Regions: Masked Attention Alignment for Data-Free Quantization of Vision Transformers

解耦信息区域的选择性耦合:用于视觉Transformer无数据量化的掩码注意力对齐

Biao Qian, Yang Wang, Yong Wu, Jungong Han

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 提出MaskAQ方法,通过解耦合成样本中的信息区域并利用掩码注意力对齐全精度模型与量化模型,解决无数据量化中分布不匹配问题。

Comments Accepted to appear at ICML 2026, Seoul, Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24561 2026-06-08 cs.LG cs.AI 版本更新

LoRA-DA: Data-Aware Initialization for Low-Rank Adaptation via Asymptotic Analysis

LoRA-DA:基于渐近分析的低秩自适应数据感知初始化

Qingyue Zhang, Chang Chu, Tianren Peng, Qi Li, Xiangyang Luo, Zhihao Jiang, Shao-Lun Huang

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 提出LoRA-DA,通过渐近分析优化低秩自适应初始化,结合Fisher梯度与Fisher信息最小化参数偏差,提升微调准确率与收敛稳定性。

Comments Published at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20963 2026-06-08 cs.LG cs.CV 版本更新

Generalization of Diffusion Models Arises with a Balanced Representation Space

扩散模型的泛化源于平衡表示空间

Zekai Zhang, Xiao Li, Xiang Li, Lianghe Shi, Meng Wu, Molei Tao, Qing Qu

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 通过分析两层ReLU去噪自编码器,证明记忆化导致局部尖峰表示,而泛化产生平衡表示,并在真实扩散模型中验证,提出基于表示的检测和编辑方法。

Comments Accepted at ICLR 2026. 40 pages, 19 figures. The first two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02014 2026-06-08 cs.CV cs.AI cs.CL cs.LG 版本更新

Rethinking Genomic Modeling Through Optical Character Recognition

通过光学字符识别重新思考基因组建模

Hongxin Xiang, Pengsen Ma, Yunkang Cao, Di Yu, Haowen Chen, Xinyu Yang, Xiangxiang Zeng

机构 * National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学)

AI总结 提出OpticalDNA框架,将DNA渲染为视觉布局,利用视觉语言模型进行OCR式基因组理解,实现高保真压缩和长序列高效处理,在450k碱基序列上以近20倍更少有效token超越基线模型。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00471 2026-06-08 cs.AI cs.CV 版本更新

Dual Latent Memory for Visual Multi-agent System

面向视觉多智能体系统的双潜在记忆

Xinlei Yu, Chengming Xu, Zhangquan Chen, Bo Yin, Cheng Yang, Yongbo He, Yihao Hu, Jiangning Zhang, Cheng Tan, Xiaobin Hu, Shuicheng Yan

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 提出L²-VMAS框架,通过双潜在记忆解耦感知与思考,并采用熵驱动主动触发机制,打破视觉多智能体系统的“扩展墙”,在提升准确率的同时大幅降低令牌消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05291 2026-06-08 cs.LG 版本更新

SHAP-Guided Kernel Actor-Critic for Explainable Reinforcement Learning

基于SHAP引导的核化Actor-Critic可解释强化学习

Na Li, Hangguan Shan, Wei Ni, Wenjie Zhang, Xinyu Li

机构 * National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学)

AI总结 提出RSA2C算法,利用RKHS-SHAP计算状态属性,通过马氏门控权重调节Actor梯度和Advantage Critic目标,实现高效、稳定且可解释的强化学习。

Journal ref ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16622 2026-06-08 cs.LG cs.AI 版本更新

E2Former-V2: On-the-Fly Equivariant Attention with Linear Activation Memory

E2Former-V2:具有线性激活内存的即时等变注意力

Lin Huang, Chengxiang Huang, Ziang Wang, Yiyue Du, Chu Wang, Haocheng Lu, Yunyang Li, Xiaoli Liu, Arthur Jiang, Jia Zhang

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 提出E2Former-V2架构,通过等变轴对齐稀疏化(EAAS)和即时等变注意力机制,利用SO(3)到SO(2)基变换和自定义Triton内核,实现线性激活内存和20倍TFLOPS提升,在SPICE和OMol25数据集上加速推理并保持预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05675 2026-06-08 cs.AI 版本更新

CHDP: Cooperative Hybrid Diffusion Policies for Reinforcement Learning in Parameterized Action Space

CHDP:参数化动作空间中强化学习的协同混合扩散策略

Bingyi Liu, Jinbo He, Haiyong Shi, Enshu Wang, Weizhen Han, Jingxiang Hao, Peixi Wang, Zhuangzhuang Zhang

机构 * National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学)

AI总结 针对混合动作空间中的策略表达力不足和高维扩展性差问题,提出协同混合扩散策略框架,通过离散和连续扩散策略的协作与顺序更新,结合码本嵌入和Q函数引导,在基准测试中成功率提升高达19.3%。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12997 2026-06-08 cs.CV cs.AI cs.LG 版本更新

Calibrating Uncertainty for Zero-Shot Adversarial CLIP

校准零样本对抗性CLIP的不确定性

Wenjing Lu, Zerui Tao, Yuning Qiu, Dongping Zhang, Yang Yang, Qibin Zhao

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 针对CLIP在零样本分类中对抗攻击脆弱且不确定性校准差的问题,提出基于狄利克雷分布重参数化的对抗微调目标,统一对齐语义结构与置信度,提升校准性和鲁棒性。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09568 2026-06-08 physics.chem-ph cs.AI cs.CV

VEDA: 3D Molecular Generation via Variance-Exploding Diffusion with Annealing

VEDA:通过退火变方差扩散实现3D分子生成

Peining Zhang, Jinbo Bi, Minghu Song

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 VEDA结合退火变方差扩散与SE(3)等价架构,高效生成准确的3D分子结构,实现高化学精度与计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21285 2026-06-08 cs.LG stat.ML 版本更新

Learnable Kernel Density Estimation for Graphs and Its Application to Graph-Level Anomaly Detection

可学习图核密度估计及其在图级异常检测中的应用

Xudong Wang, Ziheng Sun, Chris Ding, Jicong Fan

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 提出LGKDE框架,通过图神经网络表示图分布并利用最大均值差异学习多尺度核密度估计,在理论保证下有效捕获结构模式和语义变化,在图异常检测任务中优于现有方法。

Comments Accepted in the Forty-Third International Conference on Machine Learning (ICML 2026), Main Track

详情

展开后加载摘要…

URL PDF HTML 收藏