arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Science and Technology of China(中国科学技术大学)

共收录 2226
2603.21152 2026-03-27 physics.geo-ph cs.AI

TRACE: A Multi-Agent System for Autonomous Physical Reasoning for Seismology

TRACE:一种用于地震学自主物理推理的多智能体系统

Feng Liu, Jian Xu, Xin Cui, Xinghao Wang, Zijie Guo, Jiong Wang, S. Mostafa Mousavi, Xinyu Gu, Hao Chen, Ben Fei, Lihua Fang, Fenghua Ling, Zefeng Li, Lei Bai

机构 * School of Electronic Information and Electrical Engineering, Shanghai Jiao Tong University(上海交通大学电子信息与电气工程学院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) School of Earth and Space Sciences, University of Science and Technology of China(中国科学技术大学地球和空间科学学院) Department of Earth and Planetary Sciences, Harvard University(哈佛大学地球与行星科学系) Institute of Earthquake Forecasting, China Earthquake Administration(中国地震局地震预报研究所)

AI总结 TRACE通过结合大语言模型规划与正式地震学约束,从原始观测中推导出可审计的物理机制,解决了地震序列物理机制推断的挑战,推动了地球科学从专家依赖分析向知识引导的自主发现发展。

Comments 25 pages for main text and 164 pages for appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13303 2026-03-27 cs.CV

ShowTable: Unlocking Creative Table Visualization with Collaborative Reflection and Refinement

ShowTable:通过协作反思与精炼解锁创意表格可视化

Zhihang Liu, Xiaoyi Bao, Pandeng Li, Junjie Zhou, Zhaohe Liao, Yefei He, Kaixun Jiang, Chen-Wei Xie, Yun Zheng, Hongtao Xie

机构 * USTC(中国科学技术大学) CASIA(中国科学院自动化研究所) NJU(南京大学) SJTU(上海交通大学) ZJU(浙江大学) FDU(福建师范大学) Tongyi Lab(通义实验室)

AI总结 本文提出ShowTable框架,结合大语言模型与扩散模型,通过逐步自我纠正过程实现创意表格可视化,引入TableVisBench基准测试,展示其在多模态推理、生成和纠错方面的优势。

Comments Accepted to CVPR 2026, project page: https://lntzm.github.io/showtable-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22094 2026-03-26 cs.CV

Principled Steering via Null-space Projection for Jailbreak Defense in Vision-Language Models

通过空域投影实现原理化引导用于视觉-语言模型中的对抗防御

Xingyu Zhu, Beier Zhu, Shuo Wang, Junfeng Fang, Kesen Zhao, Hanwang Zhang, Xiangnan He

机构 * MoE Key Lab of BIPC, University of Science and Technology of China(北京信息科技大学MoE关键实验室,中国科学技术大学) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出NullSteer框架,通过线性变换在模型激活中构建拒绝方向,在良性子空间保持零扰动,动态诱导拒绝有害方向,提升安全性而不损害模型能力。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22070 2026-03-26 cs.CV

Adapting Point Cloud Analysis via Multimodal Bayesian Distribution Learning

通过多模态贝叶斯分布学习适应点云分析

Xingyu Zhu, Liang Yi, Shuo Wang, Wenbo Zhu, Yonglinag Wu, Beier Zhu, Hanwang Zhang

机构 * MoE Key Lab of BIPC, University of Science and Technology of China(脑信息处理实验室,中国科学技术大学) Opus AI Research(Opus AI研究院) Southeast University(东南大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出BayesMM框架,通过多模态贝叶斯分布学习实现测试时点云分析的持续适应,利用文本先验和流式视觉特征的高斯分布融合,提升在分布偏移下的鲁棒性。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21591 2026-03-26 cs.CV

CADC: Content Adaptive Diffusion-Based Generative Image Compression

CADC: 基于内容自适应的扩散生成图像压缩

Xihua Sheng, Lingyu Zhu, Tianyu Zhang, Dong Liu, Shiqi Wang, Jing Wang

机构 * City University of Hong Kong(香港城市大学) University of Science and Technology of China(中国科学技术大学) Central Media Technology Institute, Huawei(华为中央媒体技术研究院)

AI总结 本文提出CADC,通过三种创新方法解决现有图像压缩在内容自适应中的不足,实现动态对齐图像语义与结构特征。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05629 2026-03-26 cs.SE cs.CV

ROMAN: Reward-Orchestrated Multi-Head Attention Network for Autonomous Driving System Testing

ROMAN:基于奖励协调的多头注意力网络用于自动驾驶系统测试

Jianlei Chi, Yuzhen Wu, Jiaxuan Hou, Xiaodong Zhang, Ming Fan, Suhui Sun, Weijun Dai, Bo Li, Jianguo Sun, Jun Sun

机构 * IEEE Publication Technology Group(IEEE出版技术组) Hangzhou Institute of Technology, Xidian University(杭州科技学院,西安电子科技大学) Qingdao Port International Co., Ltd.(青岛港口国际有限公司) Shandong Port Qingdao Port Group Co., Ltd.(山东港口青岛港集团有限公司) University of Science and Technology of China(中国科学技术大学) Xi’an Jiaotong University(西安交通大学) Singapore Management University(新加坡管理大学)

AI总结 ROMAN通过结合多头注意力网络与交通法规加权机制,生成高风险违规场景,提升自动驾驶系统测试的全面性与针对性。

Comments The manuscript includes 13 pages, 8 tables, and 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24047 2026-03-26 cs.RO

PCHC: Enabling Preference Conditioned Humanoid Control via Multi-Objective Reinforcement Learning

PCHC:通过多目标强化学习实现基于偏好的人形机器人控制

Huanyu Li, Dewei Wang, Xinmiao Wang, Xinzhe Liu, Peng Liu, Chenjia Bai, Xuelong Li

机构 * Harbin Institute of Technology(哈尔滨工业大学) University of Science and Technology of China(中国科学技术大学) Harbin Engineering University(哈尔滨工程大学) ShanghaiTech University(上海科技大学) Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究院(TeleAI))

AI总结 本文提出PCHC框架,利用多目标强化学习实现人形机器人基于偏好的控制,通过偏好向量调节专家混合模块,使单一策略能展现多样行为,实验证明机器人可实时调整优先级。

Comments 8 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23840 2026-03-26 cs.AI cs.CL

VehicleMemBench: An Executable Benchmark for Multi-User Long-Term Memory in In-Vehicle Agents

VehicleMemBench:多用户长期记忆的可执行基准

Yuhao Chen, Yi Xu, Xinyun Ding, Xiang Fang, Shuochen Liu, Luxi Lin, Qingyu Zhang, Ya Li, Quan Liu, Tong Xu

机构 * University of Science and Technology of China(中国科学技术大学) iFLYTEK Research(iFLYTEK研究院) Xiamen University(厦门大学) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 本文提出VehicleMemBench,用于评估车载代理的多用户长期记忆能力,通过可执行仿真环境比较行动后环境状态与目标状态,揭示强大模型在动态偏好变化场景中的不足,强调需更 robust 的记忆管理机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19900 2026-03-26 cs.CV cs.GR

ExpPortrait: Expressive Portrait Generation via Personalized Representation

ExpPortrait:通过个性化表示生成表现力强的肖像

Junyi Wang, Yudong Guo, Boyang Guo, Shengming Yang, Juyong Zhang

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 本文提出一种高保真个性化头部表示,用于生成具有高表现力的肖像视频,通过引入表达转移模块实现不同身份间的头部姿态和表情细节转移,实验表明在身份保持、表情准确性和时间稳定性方面优于现有方法。

Comments CVPR 2026, Project Page: https://ustc3dv.github.io/ExpPortrait/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18996 2026-03-26 cs.CV

Learning Cross-View Object Correspondence via Cycle-Consistent Mask Prediction

通过循环一致性掩码预测学习跨视角物体对应关系

Shannan Yan, Leqi Zheng, Keyu Lv, Jingchen Ni, Hongyang Wei, Jiajun Zhang, Guangting Wang, Jing Lyu, Chun Yuan, Fengyun Rao

机构 * Tsinghua University(清华大学) WeChat Vision, Tencent Inc.(腾讯微信视觉实验室) USTC(中国科学技术大学)

AI总结 本文提出基于条件二值分割的框架,通过循环一致性训练目标视角预测掩码并重建源视角掩码,实现无标注的自监督学习,提升跨视角物体对应性能。

Comments The paper has been accepted to CVPR 2026 main track

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12410 2026-03-26 cs.AI

Are LLMs Smarter Than Chimpanzees? An Evaluation on Perspective Taking and Knowledge State Estimation

LLMs比黑猩猩更聪明吗?对视角取和知识状态估计的评估

Dingyi Yang, Junqi Zhao, Xue Li, Ce Li, Boyang Li

机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) University of Science and Technology of China(中国科学技术大学) China University of Mining and Technology(中国矿业大学)

AI总结 本文评估LLM在预测角色下一步行动及检测角色不应具备的知识能力,发现当前最先进的LLM在两项任务上表现接近随机,远低于人类。

Comments 23 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23168 2026-03-25 cs.CV

GSwap: Realistic Head Swapping with Dynamic Neural Gaussian Field

GSwap:基于动态神经高斯场的逼真头部交换

Jingtao Zhou, Xuan Gao, Dongyu Liu, Junhui Hou, Yudong Guo, Juyong Zhang

机构 * School of Mathematical Science, University of Science and Technology of China(中国科学技术大学数学科学学院) Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系)

AI总结 GSwap通过动态神经高斯场实现逼真头部交换,克服传统方法在3D一致性、面部表情和合成质量上的不足,提升整体视觉质量和3D一致性。

Comments Accepted to TVCG, Project page: https://ustc3dv.github.io/GSwap/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22819 2026-03-25 cs.CV cs.AI

TDATR: Improving End-to-End Table Recognition via Table Detail-Aware Learning and Cell-Level Visual Alignment

TDATR:通过表格细节感知学习和单元级视觉对齐改进端到端表格识别

Chunxia Qin, Chenyu Liu, Pengcheng Xia, Jun Du, Baocai Yin, Bing Yin, Cong Liu

机构 * University of Science and Technology of China(中国科学技术大学) iFLYTEK Research(iFLYTEK研究院)

AI总结 TDATR通过表格细节感知学习和单元级视觉对齐改进端到端表格识别,采用感知-融合策略,提升模型鲁棒性和识别精度,无需数据集特定微调即可在七个基准上取得领先性能。

Comments Acceptd by CVPR 2026. Project Page: https://github.com/Chunchunwumu/TDATR.git

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20644 2026-03-25 cs.CV

ScaleEdit-12M: Scaling Open-Source Image Editing Data Generation via Multi-Agent Framework

ScaleEdit-12M:通过多智能体框架实现开源图像编辑数据生成的规模化

Guanzhou Chen, Erfei Cui, Changyao Tian, Danni Yang, Ganlin Yang, Yu Qiao, Hongsheng Li, Gen Luo, Hongjie Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) CUHK MMLab(香港中文大学多模态实验室) Fudan University(复旦大学) University of Science and Technology of China(中国科学技术大学) Xiamen University(厦门大学)

AI总结 本文提出ScaleEditor框架,通过多智能体方法构建大规模高质量图像编辑数据集,生成ScaleEdit-12M,涵盖23类任务,提升多种编辑模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13719 2026-03-25 cs.CV cs.AI cs.IR

Hierarchical Long Video Understanding with Audiovisual Entity Cohesion and Agentic Search

基于音频视觉实体凝聚力与代理搜索的层次化长视频理解

Xinlei Yin, Xiulian Peng, Xiao Li, Zhiwei Xiong, Yan Lu

机构 * University of Science and Technology of China(中国科学技术大学) Microsoft Research Asia(微软亚洲研究院)

AI总结 本文提出HAVEN框架,通过整合音频视觉实体凝聚力与层次化视频索引与代理搜索,解决长视频理解中的信息碎片化和全局一致性问题,实验显示在LVBench上达到84.1%的准确率。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13285 2026-03-25 cs.CL

DualEdit: Mitigating Safety Fallback in LLM Backdoor Editing via Affirmation-Refusal Regulation

DualEdit: 通过肯定-拒绝调节缓解LLM后门编辑中的安全回退

Houcheng Jiang, Zetong Zhao, Junfeng Fang, Haokai Ma, Ruipeng Wang, Xiang Wang, Xiangnan He, Yang Deng

机构 * University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学) Singapore Management University(新加坡管理大学) MoE Key Lab of BIPC, University of Science and Technology of China(中国科学技术大学信息与通信技术国家重点实验室)

AI总结 DualEdit通过双重目标模型编辑框架缓解LLM后门攻击中的安全回退问题,通过动态损失加权和价值锚定技术提升攻击成功率并降低安全回退率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22187 2026-03-24 cs.CV cs.AI

Seeing is Improving: Visual Feedback for Iterative Text Layout Refinement

视觉反馈提升布局:用于迭代文本布局优化的视觉反馈

Junrong Guo, Shancheng Fang, Yadong Qu, Hongtao Xie

机构 * University of Science and Technology of China(中国科学技术大学) Shenzhen University(深圳大学)

AI总结 本文提出VFLM模型,通过视觉反馈迭代优化文本布局,提升生成质量,实验表明其优于现有方法。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21904 2026-03-24 cs.CV cs.AI

SHAPE: Structure-aware Hierarchical Unsupervised Domain Adaptation with Plausibility Evaluation for Medical Image Segmentation

SHAPE:基于结构的分层无监督领域自适应与合理性评估用于医学图像分割

Linkuan Zhou, Yinghao Xia, Yufei Shen, Xiangyu Li, Wenjie Du, Cong Cong, Leyi Wei, Ran Su, Qiangguo Jin

机构 * School of Software, Northwestern Polytechnical University(西北工业大学软件学院) School of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院) School of Software Engineering, USTC(USTC软件工程学院) Australian Institute of Health Innovation, Macquarie University(麦考瑞大学健康创新研究所) Faculty of Applied Science, Macao Polytechnic University(澳门理工学院应用科学学院) School of Computer Software, Tianjin University(天津大学计算机软件学院)

AI总结 SHAPE通过结构感知的分层无监督领域自适应与合理性评估,提升医学图像分割在跨模态任务中的性能,采用超图合理性估计和结构异常修剪方法,显著提高心脏和腹部数据的Dice分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21875 2026-03-24 eess.AS cs.CL cs.SD

Disentangling Speaker Traits for Deepfake Source Verification via Chebyshev Polynomial and Riemannian Metric Learning

通过切比雪夫多项式和黎曼度量学习实现深度伪造源验证的说话人特性解耦

Xi Xuan, Wenxin Zhang, Zhiyu Li, Jennifer Williams, Ville Hautamäki, Tomi H. Kinnunen

机构 * University of Eastern Finland(东芬兰大学) City University of Hong Kong(香港城市大学) University of Southampton(南安普顿大学) University of Chinese Academy of Sciences(中国科学院大学) University of Science and Technology of China(中国科学技术大学)

AI总结 本文提出SDML框架,通过切比雪夫多项式和黎曼度量学习解耦说话人特性,提升深度伪造源验证的准确性。

Comments Submitted to Interspeech 2026; The code, evaluation protocols and demo website are available at https://github.com/xxuan-acoustics/RiemannSD-Net

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21647 2026-03-24 cs.CV cs.LG

FedCVU: Federated Learning for Cross-View Video Understanding

FedCVU: 联邦学习用于跨视图视频理解

Shenghan Zhang, Run Ling, Ke Cao, Ao Ma, Zhanjie Zhang

机构 * Software College, Northeastern University, Shenyang, China(东北大学软件学院) University of Science and Technology of China, Hefei, China(中国科学技术大学) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学) Zhejiang University, Hangzhou, China(浙江大学)

AI总结 FedCVU通过VS-Norm、CV-Align和SLA解决联邦学习在跨视图视频理解中的异质视角、分布偏差和通信开销问题,提升未见视角性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08536 2026-03-24 cs.CV

SWIFT: Sliding Window Reconstruction for Few-Shot Training-Free Generated Video Attribution

SWIFT: 基于滑动窗口的少样本训练自由生成视频属性识别

Chao Wang, Zijin Yang, Yaofei Wang, Yuang Qi, Weiming Zhang, Nenghai Yu, Kejiang Chen

机构 * University of Science and Technology of China(中国科学技术大学) Hefei University of Technology(合肥工业大学)

AI总结 本文提出SWIFT方法,通过滑动窗口实现视频属性识别,无需额外训练即可在多种生成模型上达到90%以上的准确率,支持零样本识别。

Comments 8 pages. Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21499 2026-03-24 cs.CV

Easy3E: Feed-Forward 3D Asset Editing via Rectified Voxel Flow

Easy3E: 通过校正体素流实现的前馈3D资产编辑

Shimin Hu, Yuanyi Wei, Fei Zha, Yudong Guo, Juyong Zhang

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 本文提出基于TRELLIS生成框架的高效前馈3D编辑方法,通过单视角编辑实现3D模型修改,解决训练自由2D编辑适应结构化3D表示及压缩3D特征外观保真度瓶颈问题。

Comments CVPR 2026, Project Page: https://ustc3dv.github.io/Easy3E/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24845 2026-03-24 cs.RO

ArtiSG: Functional 3D Scene Graph Construction via Human-demonstrated Articulated Objects Manipulation

ArtiSG: 通过人类示范的可动物体操作构建功能3D场景图

Qiuyi Gu, Yuze Sheng, Jincheng Yu, Jiahao Tang, Xiaolong Shan, Zhaoyang Shen, Tinghao Yi, Xiaodan Liang, Xinlei Chen, Yu Wang

机构 * Tsinghua University(清华大学) University of Science and Technology of China(中国科学技术大学) Openmind Pengcheng Laboratory(鹏城实验室)

AI总结 ArtiSG通过编码人类示范到结构化机器人记忆中,构建功能3D场景图,解决现有方法在可动物体操作信息获取上的不足,提升机器人在真实环境中的任务执行能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11026 2026-03-24 cs.CV

GIR-Bench: Versatile Benchmark for Generating Images with Reasoning

GIR-Bench:用于生成图像的多功能基准

Hongxiang Li, Yaowei Li, Bin Lin, Yuwei Niu, Yuhang Yang, Xiaoshuang Huang, Jiayin Cai, Xiaolong Jiang, Yao Hu, Long Chen

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Peking University(北京大学) University of Science and Technology of China(中国科学技术大学) Xiaohongshu Inc.(小红书公司)

AI总结 本文提出GIR-Bench,从理解-生成一致性、文本到图像生成和多步骤编辑三个角度评估统一模型,揭示其在复杂视觉任务中的表现与不足。

Comments ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08771 2026-03-24 cs.CV

LinearSR: Unlocking Linear Attention for Stable and Efficient Image Super-Resolution

LinearSR: 解锁线性注意力以实现稳定且高效的图像超分辨率

Xiaohui Li, Shaobin Zhuang, Shuo Cao, Yang Yang, Yuandong Pu, Qi Qin, Siqi Luo, Bin Fu, Yihao Liu

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) University of Science and Technology of China(中国科学技术大学) The Australian National University(澳大利亚国立大学)

AI总结 本文提出LinearSR框架,首次系统解决线性注意力在图像超分辨率中的关键挑战,通过改进的早停指导微调策略、SNR基专家混合架构和TAG指导范式,实现高质量与高效兼顾的超分辨率生成。

Comments Camera Ready of ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06638 2026-03-24 cs.CV cs.AI

StaR-KVQA: Structured Reasoning Traces for Implicit-Knowledge Visual Question Answering

StaR-KVQA:用于隐式知识视觉问答的结构化推理轨迹

Zhihao Wen, Wenkang Wei, Yuan Fang, Xingtong Yu, Hui Zhang, Weicheng Zhu, Xin Zhang

机构 * Ant International, Ant Group(蚂蚁集团国际部,蚂蚁集团) School of Computer Science and Technology, University of Science and Technology of China(中国科学技术大学计算机科学与技术学院) School of Computing and Information Systems, Singapore Management University(新加坡管理学院计算与信息系统学院) Anhui Provincial Key Laboratory of High Performance Computing(安徽省高性能计算重点实验室)

AI总结 StaR-KVQA通过引入双路径结构化推理轨迹提升隐式知识视觉问答的准确性与推理透明度,采用自蒸馏方法构建轨迹增强数据集,无需外部检索工具,在OK-VQA基准上实现11.3%的精度提升。

Comments 8+3+3 pages, code: https://github.com/jianyingzhihe/StaR-KVQA

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20382 2026-03-24 cs.CV

Uni-Classifier: Leveraging Video Diffusion Priors for Universal Guidance Classifier

Uni-Classifier: 利用视频扩散先验进行通用引导分类器

Yujie Zhou, Pengyang Ling, Jiazi Bu, Bingjie Gao, Li Niu

机构 * Shanghai Jiao Tong University(上海交通大学) University of Science and Technology of China(中国科学技术大学)

AI总结 本文提出Uni-Classifier,通过利用视频扩散先验引导前序模型的去噪过程,提升生成质量,适用于视频和3D生成任务。

Comments Accepted by ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20307 2026-03-24 cs.CV cs.AI cs.MM cs.SD

EARTalking: End-to-end GPT-style Autoregressive Talking Head Synthesis with Frame-wise Control

EARTalking:端到端的GPT风格自回归说话头合成与帧级控制

Yuzhe Weng, Haotian Wang, Yuanhong Yu, Jun Du, Shan He, Xiaoyan Wu, Haoran Xu

机构 * University of Science and Technology of China(中国科学技术大学) iFLYTEK Zhejiang University(浙江大学)

AI总结 本文提出EARTalking,一种端到端的GPT风格自回归模型,用于交互式音频驱动说话头生成,通过引入帧级流式生成范式和Sink Frame Window Attention机制,实现高效可控的视频生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20262 2026-03-24 q-bio.BM cs.AI cs.LG

Deciphering Scientific Reasoning Steps from Outcome Data for Molecule Optimization

从结果数据中解码科学推理步骤以优化分子

Zequn Liu, Kehan Wu, Shufang Xie, Zekun Guo, Wei Zhang, Tao Qin, Renhe Liu, Yingce Xia

机构 * Zhongguancun Academy(中关村学院) School of Computer Science and Technology, University of Science and Technology of China(中国科学技术大学计算机科学与技术学院) Global Health Drug Discovery Institute(全球健康药物发现研究所)

AI总结 本文提出DESRO框架,通过分析分子属性记录中的共享片段,利用LLM恢复分子优化的推理逻辑,并在15项任务中取得最高成功率,展示了从结果数据解码推理步骤的可行性。

Comments Work in progress, 37 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19896 2026-03-23 cs.AI

Utility-Guided Agent Orchestration for Efficient LLM Tool Use

基于效用的代理协调以提高大语言模型工具使用效率

Boyan Liu, Gongming Zhao, Hongli Xu

机构 * University of Science and Technology of China(科学技术大学)

AI总结 本文提出一种基于效用的代理协调策略,通过平衡收益、成本、不确定性及冗余性来优化大语言模型工具使用中的质量与成本权衡。实验表明显式协调信号显著影响代理行为。

详情

展开后加载摘要…

URL PDF HTML 收藏