arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Shanghai Jiao Tong University(上海交通大学)

共收录 3140
2606.01022 2026-06-02 cs.CV cs.AI

ProductWebGen: Benchmarking Multimodal Product Webpage Generation

ProductWebGen: 多模态产品网页生成基准测试

Zhihong Liu, Siqi Kou, Zheng Li, Ye Ma, Quan Chen, Peng Jiang, Kai Yu, Zhijie Deng

机构 * School of Computer Science & Zhiyuan College(计算机科学学院及智远学院) Shanghai Jiao Tong University(上海交通大学) Kuaishou Technology(快手科技)

AI总结 提出ProductWebGen基准,用于评估多模态生成模型从产品图像和指令生成一致产品展示网页的能力,并比较了基于编辑和基于统一模型两种工作流。

Comments Accepted by KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00997 2026-06-02 cs.CL

Decoding in Order-Agnostic Language Models: Chain-Rule Deviation and Uniform Spreading

顺序无关语言模型中的解码:链式法则偏差与均匀扩散

Lin Yao

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) Zhongguancun Academy(中关村学院)

AI总结 本文研究顺序无关语言模型(OALM)中揭示顺序对似然的影响,提出基于置信度方差的诊断方法,并证明均匀扩散定理以优化解码路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00822 2026-06-02 cs.IR cs.AI

SkillPager: Query-Adaptive Intra-Skill Navigation via Semantic Node Retrieval

SkillPager: 通过语义节点检索实现查询自适应的技能内导航

Zicai Cui, Zihan Guo, Weiwen Liu, Weinan Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Sun Yat-sen University(中山大学)

AI总结 针对基于技能的LLM代理在长过程文档中需要高效检索的问题,提出SkillPager两阶段框架,通过离线解析Markdown技能为类型化语义节点并在线利用MMR进行查询条件节点选择,在保持高上下文充分性的同时显著减少提示令牌。

Comments 20 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00700 2026-06-02 cs.LG cs.AI

COPF: An Online Framework for Deployment-Stable Counterfactual Fairness in Evolving Graphs

COPF:演化图中部署稳定的反事实公平性在线框架

Sheng'en Li, Dongmian Zou

机构 * Shanghai Jiao Tong University(上海交通大学)

AI总结 针对演化图上的在线链接推荐,提出COPF框架,通过反事实暴露机会差距、显式探索和残差不可区分性审计,实现部署稳定的公平性监控与控制。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00510 2026-06-02 cs.CL cs.AI

Skill or Skip? Learning Selective Skill Invocation in Agentic Tasks via Dual-Granularity Preference Learning

技能还是跳过?通过双粒度偏好学习在智能体任务中学习选择性技能调用

Chishui Chen, Jiaye Lin, Te Sun, Junxi Wang, Yi Yang, Cong Qin, Yangen Hu, Lu Pan, Ke Zeng

机构 * Meituan(美团) Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学) Nanjing University(南京大学) Peking University(北京大学)

AI总结 提出SelSkill框架,通过双粒度偏好学习实现选择性技能调用,在ALFWorld和BFCL上显著提升任务成功率和执行精度。

Comments 18 pages, 4 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00507 2026-06-02 cs.CL

LaSR: Context-Aware Speech Recognition via Latent Reasoning

LaSR:通过潜在推理实现上下文感知的语音识别

Heyang Liu, Ziyang Cheng, Jiayi Huang, Wenyang Xiao, Ronghua Wu, Qunshan Gu, Yanfeng Wang, Yu Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Ant Group(蚂蚁集团)

AI总结 提出LaSR训练范式,利用潜在推理轨迹增强语音大语言模型的上下文感知能力,在学术术语识别上显著提升性能且不增加延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00156 2026-06-02 eess.IV cs.AI

A physics-informed foundation model for quantitative diffusion MRI

一种用于定量扩散MRI的物理信息基础模型

Zihan Li, Jialan Zheng, Ziyu Li, Xun Yuan, Kasidit Anmahapong, Ziang Wang, Mingxuan Liu, Hongjia Yang, Yifei Chen, Zhuhao Wang, Yuhang He, Fang Chen, Rui Li, Huaiqiang Sun, Yi Liao, Congyu Liao, Yang Yang, Haibo Qu, Xue Zhang, Hongen Liao, Qiyuan Tian

机构 * School of Biomedical Engineering, Tsinghua University(清华大学生物医学工程系) Oxford Centre for Integrative Neuroimaging, FMRIB, Nuffield Department of Clinical Neurosciences, University of Oxford(牛津大学整合神经影像中心、FMRIB、临床神经科学系) Department of Radiology, West China Second University Hospital, Sichuan University(四川大学华西第二医院放射科) School of Biomedical Engineering and the Institute of Medical Robotics, Shanghai Jiaotong University(上海交通大学生物医学工程学院和医学机器人研究院) Department of Radiology, Institution of Radiology and Medical Imaging, West China Hospital, Sichuan University(四川大学华西医院放射科、放射医学与影像研究所) Department of Radiology and Biomedical Imaging, University of California San Francisco(加州大学旧金山分校放射科和生物医学影像系) Department of Psychiatry and Behavioral Sciences, Stanford University School of Medicine(斯坦福大学医学院精神病学与行为科学系)

AI总结 提出物理信息生成微结构网络(PIGMENT),通过零样本适应实现从稀疏数据中恢复可靠的定量扩散MRI参数映射。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00139 2026-06-02 cs.CV cs.AI

Geodesics with Unified Tangent-constrained Priors and Curvature Regularization

具有统一切线约束先验和曲率正则化的测地线

Chong Di, Li Liu, Jinglin Zhang, Zhenjiang Li, Da Chen, Laurent D. Cohen

机构 * Shandong Artificial Intelligence Institute, Qilu University of Technology (Shandong Academy of Sciences)(山东省人工智能研究院,齐鲁工业大学(山东省科学院)) Yuanshen Rehabilitation Institute, Shanghai Jiao Tong University School of Medicine(元身康复研究院,上海交通大学医学院) School of Control Science and Engineering, Shandong University(控制科学与工程学院,山东大学) Department of Radiation Oncology, Shandong Cancer Hospital and Institute, Shandong First Medical University, Shandong Academy of Medical Sciences(放疗科,山东省肿瘤医院及研究院,山东第一医科大学,山东省医学科学院) CEREMADE, Université Paris Dauphine, Université-PSL, CNRS, UMR 7534(CEREMADE,巴黎大学Dauphine,Université-PSL,CNRS,UMR 7534)

AI总结 提出一种在方向提升空间中融合切线约束先验与曲率惩罚的测地线框架,通过快速行进法高效求解HJB PDE,增强复杂形状图像分割的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25246 2026-06-02 cs.AI

FrontierOR: Benchmarking LLMs' Capacity for Efficient Algorithm Design in Large-Scale Optimization

FrontierOR:基准测试大语言模型在大规模优化中高效算法设计的能力

Minwei Kong, Chonghe Jiang, Ao Qu, Wenbin Ouyang, Zhaoming Zeng, Xiaotong Guo, Zhekai Li, Junyi Li, Yi Fan, Xinshou Zheng, Xi Jing, Yikai Zhang, Zhiwei Liang, Seonghoo Kim, Runqing Yang, Zijian Zhou, Sirui Li, Han Zheng, Wangyang Ying, Ou Zheng, Chonghuan Wang, Jinglong Zhao, Hanzhang Qin, Cathy Wu, Paul Pu Liang, Jinhua Zhao, Hai Wang

机构 * Singapore-MIT Alliance for Research and Technology(新加坡-麻省理工联盟研究技术) Massachusetts Institute of Technology(麻省理工学院) Northeastern University(东北大学) Uber Shanghai Jiaotong University(上海交通大学) Boston University(波士顿大学) Emory University(埃默里大学) Northwestern University(西北大学) National University of Singapore(国立新加坡大学) Microsoft(微软) University of Texas at Dallas(德克萨斯大学达拉斯分校) Singapore Management University(新加坡管理学院)

AI总结 提出FrontierOR基准,系统评估大语言模型在现实大规模优化问题中设计可扩展算法(而非仅生成求解器代码)的能力,发现最强模型仅在31%案例中优于Gurobi。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29948 2026-06-02 cs.SD cs.AI eess.AS

HoliTok:A Coutinuous Holistic Tokenization with Robust Dual Capabilities of Speech Generation and Understanding

HoliTok: 一种具有鲁棒的双重语音生成与理解能力的连续整体式分词

Bohan Li, Shi Lian, Hankun Wang, Yiwei Guo, Yu Xi, Zhihan Li, Da Zheng, Colin Zhang, Kai Yu

机构 * X-LANCE Lab, School of Computer Science, Shanghai Jiao Tong University, China(X-LANCE实验室,计算机科学学院,上海交通大学,中国) hi lab, Xiaohongshu Inc, China(hi实验室,小红书公司,中国)

AI总结 提出HoliTok连续整体式语音分词模型,通过渐进训练策略联合保持信号保真度、融入语义信息并维持潜在可学习性,基于该分词构建统一AR+DiT模型实现语音合成与识别,实验证明其在统一生成-理解架构中无需额外优化即可鲁棒运行。

Comments 14 pages, 2 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29287 2026-06-02 cs.IR cs.CV

UniNote: A Unified Embedding Model for Multimodal Representation and Ranking

UniNote: 一种用于多模态表示和排序的统一嵌入模型

Jinghan Zhao, Wenwei Jin, Anqi Li, Jintao Tong, Luya Mo, Jiawei Li, Bin Li, Yao Hu

机构 * Xiaohongshu Beijing China(小红书北京中国) Shanghai Jiao Tong University(上海交通大学) Huazhong University of Science and Technology(华中科技大学) Beijing Institute of Technology(北京理工大学)

AI总结 提出UniNote统一嵌入模型,通过两阶段训练(对比SFT和强化学习)解决工业级Item-to-Item检索中全局表示与局部检索的平衡、解耦流水线效率及精度-延迟权衡问题,在小红书部署后显著提升检索质量和成本效率。

Comments Accepted by KDD Ads Track 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24828 2026-06-02 cs.AI

Test-Time Deep Thinking to Explore Implicit Rules

测试时深度思考以探索隐式规则

Wentong Chen, Xin Cong, Zhong Zhang, Yaxi Lu, Siyuan Zhao, Yesai Wu, Qinyu Luo, Haotian Chen, Yankai Lin, Zhiyuan Liu, Maosong Sun

机构 * Renmin University of China(中国人民大学) Department of Statistics and Data Science, Tsinghua University(清华大学统计与数据科学系) School of Computer Science and Engineering, UESTC(UESTC计算机科学与工程学院) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) School of Mathematical Sciences, Nankai University(南开大学数学科学学院) Whiting School, Johns Hopkins University(约翰斯·霍普金斯大学惠特林学院) School of Artificial Intelligence, Shanghai Jiaotong University(上海交通大学人工智能学院)

AI总结 针对智能体在隐式规则环境中失败的问题,提出TTExplore框架,通过训练专用模型Exp-Thinker进行测试时推理,平均提升基线性能14-19点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24005 2026-06-02 cs.AI cs.CL

LC-ERD: Mining Latent Logic for Self-Evolving Reasoning via Consistency-Regulated Reward Decomposition

LC-ERD:通过一致性调节奖励分解挖掘潜在逻辑以实现自我进化推理

Yanyu Chen, Jiyue Jiang, Dianzhi Yu, Zheng Wu, Jiahong Liu, Jiaming Han, Xiao Guo, Jinhu Qi, Yu Li, Yifei Zhang, Irwin King

机构 * The Chinese University of Hong Kong(香港中文大学) Shanghai Jiaotong University(上海交通大学) Fudan University(复旦大学)

AI总结 针对大语言模型推理中高质量过程数据稀缺的问题,提出LC-ERD框架,通过潜在逻辑挖掘和一致性调节的奖励分解,实现自我对齐与推理进化。

Comments Accepted in SIGKDD 2026 Research Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19344 2026-06-02 cs.CL

Retrieval-Augmented Linguistic Calibration

检索增强的语言校准

Yi-Fan Yeh, Linwei Tao, Minjing Dong, Tao Huang, Jialin Yu, Philip Torr, Chang Xu

机构 * School of Computer Science, University of Sydney(悉尼大学计算机科学学院) City University of Hong Kong(香港城市大学) Shanghai Jiao Tong University(上海交通大学) University of Oxford, Department of Engineering Science(牛津大学工程科学系) Department of Engineering Science, University of Oxford(牛津大学工程科学系)

AI总结 提出检索增强的语言校准(RALC)框架,通过分布建模和检索增强改写,提升语言置信度表达的真实性和校准性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17921 2026-06-02 cs.CV

An Efficient Streaming Video Understanding Framework with Agentic Control

一种具有代理控制的高效流式视频理解框架

Jinming Liu, Jianguo Huang, Zhaoyang Jia, Jiahao Li, Xiaoyi Zhang, Zongyu Guo, Bin Li, Wenjun Zeng, Yan Lu, Xin Jin

机构 * Shanghai Jiao Tong University(上海交通大学) Eastern Institute of Technology, Ningbo, China(宁波工程技术学院) Microsoft Research Asia(微软亚洲研究院)

AI总结 提出R3-Streaming框架,通过级联控制(记忆压缩、响应判断、计算路由)和年龄感知遗忘策略及目标平衡强化学习(TB-GRPO),在严格延迟预算下实现流式视频理解,性能达到SOTA并减少95-96%视觉令牌使用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13527 2026-06-02 cs.AI

MMSkills: Towards Multimodal Skills for General Visual Agents

MMSkills: 面向通用视觉智能体的多模态技能

Kangning Zhang, Shuai Shao, Qingyao Li, Jianghao Lin, Lingyue Fu, Shijian Wang, Wenxiang Jiao, Yuan Lu, Weiwen Liu, Weinan Zhang, Yong Yu

机构 * Shanghai Jiao Tong University(上海交通大学) Xiaohongshu Inc.(小红书公司) Southeast University(东南大学)

AI总结 提出MMSkills框架,通过将多模态程序知识编码为紧凑的状态条件包(包含文本程序、运行时状态卡和多视角关键帧),并利用轨迹到技能生成器和分支加载多模态技能智能体,显著提升GUI和游戏场景下视觉智能体的决策能力。

Comments 25 pages, 8 figures, 8 tables. Project page: https://zkangning.github.io/MMSkills_for_Visual_Agents/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12369 2026-06-02 cs.RO

GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization

GuidedVLA: 通过即插即用的动作注意力特化指定任务相关因素

Xiaosong Jia, Bowen Yang, Zuhao Ge, Xian Nie, Yuchen Zhou, Cunxin Fan, Yufeng Li, Yilin Chai, Chao Jing, Zijian Liang, Qingwen Bu, Haidong Cao, Chao Wu, Qifeng Li, Zhenjie Yang, Chenhe Zhang, Hongyang Li, Zuxuan Wu, Junchi Yan, Yu-Gang Jiang

机构 * Institute of Trustworthy Embodied AI (TEAI)(可信具身人工智能研究院) Shanghai Key Laboratory of Multimodal Embodied AI(上海多模态具身人工智能重点实验室) Shanghai Jiao Tong University(上海交通大学) OpenDriveLab, The University of Hong Kong(OpenDrive实验室,香港大学)

AI总结 提出GuidedVLA框架,通过为动作解码器中的注意力头分配人工定义的辅助信号(如物体定位、空间几何、时序技能逻辑),显式引导模型关注任务相关因素,提升VLA模型在域内和域外场景的成功率。

Comments Accepted to RSS 2026. Project page: https://guidedvla.github.io/project_page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09503 2026-06-02 cs.CV

PermuQuant: Lowering Per-Group Quantization Error by Reordering Channels for Diffusion Models

PermuQuant:通过重新排列通道降低扩散模型每组量化误差

Yongsen Cheng, Kai Liu, Kaiwen Tao, Junxian Li, Zhixin Wang, Zhikai Chen, Renjing Pei, Yulun Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Huawei Noah’s Ark Lab(华为诺亚实验室)

AI总结 提出PermuQuant框架,通过基于联合二阶矩的通道重排序和校准接受规则,降低低比特扩散模型每组量化误差,实现显著加速和内存压缩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07177 2026-06-02 cs.CR cs.AI

Safe-FedLLM: Delving into the Safety of Federated Large Language Models

Safe-FedLLM:深入探究联邦大语言模型的安全性

Mingxiang Tao, Yu Tian, Wenxuan Tu, Yue Yang, Xue Yang, Xiangyan Tang

机构 * Hainan University(海南大学) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出Safe-FedLLM,一种基于探针的防御框架,通过三级防御(步骤级、客户端级和阴影级)利用轻量级分类器区分恶意与良性LoRA更新,以增强联邦大语言模型对恶意客户端的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05367 2026-06-02 cs.CR cs.AI

Between a Rock and a Hard Place: The Tension Between Ethical Reasoning and Safety Alignment in LLMs

进退维谷:大型语言模型中伦理推理与安全对齐之间的张力

Shei Pern Chua, Zhen Leng Thai, Kai Jun Teh, Xiao Li, Qibing Ren, Xiaolin Hu

机构 * Department of Computer Science and Technology, Institute for AI, BNRist, Tsinghua University(计算机科学与技术系,人工智能研究院,BNRist,清华大学) IDG/McGovern Institute for Brain Research, Tsinghua University(IDG/麦克戈文脑科学研究院,清华大学) Chinese Institute for Brain Research (CIBR)(中国脑科学研究院(CIBR)) Shanghai Jiao Tong University(上海交通大学) ByteDance(字节跳动)

AI总结 本文提出TRIAL多轮红队方法,通过将有害请求嵌入伦理框架来利用模型伦理推理能力,并引入ERR防御框架(分层有害门控LoRA架构)以区分工具性回应与解释性回应,实现鲁棒防御。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09456 2026-06-02 cs.CV cs.CL cs.CR

IAG: Input-aware Backdoor Attack on VLM-based Visual Grounding

IAG: 基于输入感知的后门攻击针对VLM视觉定位

Junxian Li, Beining Xu, Simin Chen, Jiatong Li, Jingdi Lei, Haodong Zhao, Di Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) Columbia University(哥伦比亚大学) Hong Kong Polytechnic University(香港理工大学) Nanyang Technological University(南洋理工大学)

AI总结 提出IAG方法,通过文本条件UNet动态生成输入感知的触发器,实现首个多目标后门攻击VLM视觉定位,在多个模型和基准上达到最佳攻击成功率且不影响正常性能。

Comments Accepted by CVPR 2026; Code is at https://github.com/lijunxian111/IAG

Journal ref https://openaccess.thecvf.com/content/CVPR2026/papers/Li_IAG_Input-aware_Backdoor_Attack_on_VLM-based_Visual_Grounding_CVPR_2026_paper.pdf

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14465 2026-06-02 cs.AI

AgentProcessBench: Diagnosing Step-Level Process Quality in Tool-Using Agents

AgentProcessBench:诊断工具使用代理的步骤级过程质量

Shengda Fan, Xuyan Ye, Yupeng Huo, Zhi-Yuan Chen, Yiju Guo, Shenzhi Yang, Wenkai Yang, Shuqi Ye, Jingwen Chen, Haotian Chen, Xin Cong, Yankai Lin

机构 * Renmin University of China(中国人民大学) Beijing Jiaotong University(北京交通大学) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学)

AI总结 提出AgentProcessBench基准,通过三元标注方案和错误传播规则评估工具增强轨迹中的步骤级有效性,揭示当前模型在区分中立与错误动作方面的挑战,并证明过程信号对结果监督的补充价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09529 2026-06-02 cs.CV

RESBev: Making BEV Perception More Robust

RESBev:使BEV感知更加鲁棒

Lifeng Zhuo, Kefan Jin, Zhe Liu, Hesheng Wang

机构 * Shanghai Jiao Tong University(上海交通大学)

AI总结 提出RESBev,一种即插即用的鲁棒BEV感知方法,通过构建潜在世界模型学习时空相关性来预测干净BEV特征,从而在无需修改骨干网络的情况下增强对自然扰动和对抗攻击的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25773 2026-06-02 cs.CV cs.AI cs.CL

v-HUB: A Benchmark for Video Humor Understanding from Vision and Sound

v-HUB: 从视觉和声音理解视频幽默的基准

Zhengpeng Shi, Yanpeng Zhao, Jianqun Zhou, Yuxuan Wang, Qinrong Cui, Wei Bi, Songchun Zhu, Bo Zhao, Zilong Zheng

机构 * Shanghai Jiao Tong University(上海交通大学) Wuhan University(武汉大学) Beijing Institute for General Artificial Intelligence(北京一般人工智能研究院) Independent Researcher(独立研究者)

AI总结 提出v-HUB基准,通过非语言短视频评估多模态大语言模型在仅凭视觉线索理解幽默的能力,并发现音频信息有助于提升幽默理解。

Comments 24 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03202 2026-06-02 cs.CL

Code2Math: Can Your Code Agent Effectively Evolve Math Problems Through Exploration?

Code2Math:你的代码智能体能否通过探索有效演化数学问题?

Dadi Guo, Yuejin Xie, Qingyu Liu, Weixian Huang, Jiayu Liu, Zhiyuan Fan, Qihan Ren, Shuai Shao, Tianyi Zhou, Jianjie Feng, Wenze Su, Yujiu Yang, Dongrui Liu, Yi R. Fung

机构 * Hong Kong University of Science and Technology(香港科技大学) Tsinghua University(清华大学) Zhejiang University(浙江大学) Nanjing Tech University(南京工业大学) Shanghai Jiao Tong University(上海交通大学) University of Michigan(密歇根大学) Independent Researcher(独立研究者)

AI总结 本文提出一个多智能体框架,利用代码智能体通过探索将现有数学问题自主演化为更复杂、更困难的变体,并验证其可解性和难度提升。

Comments 38 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07436 2026-06-02 cs.AI

LocalSearchBench: Benchmarking Agentic Search in Real-World Local Life Services

LocalSearchBench:现实本地生活服务中的智能搜索基准测试

Hang He, Chuhuai Yue, Chengqi Dong, Mingxue Tian, Hao Chen, Zhenfeng Liu, Jiajun Chai, Xiaohan Wang, Yufei Zhang, Qun Liao, Guojun Yin, Wei Lin, Chengcheng Wan, Haiying Sun, Ting Su

机构 * Meituan, Beijing, China(美团,北京,中国) East China Normal University Shanghai Innovation Institute(东华大学上海创新研究院) University of Science and Technology of China(中国科学技术大学) Shanghai Jiaotong University(上海交通大学) North China University of Technology, Beijing, China(华北理工大学,北京,中国) East China Normal University Shanghai China(东华大学上海)

AI总结 针对本地生活服务领域,提出包含130万商家条目和900个多跳问答任务的基准测试LocalSearchBench,并开发统一环境LocalPlayground,实验表明现有大推理模型性能不足。

Comments 12 pages; accepted to KDD 2026

Journal ref Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining V.2 (KDD 2026), August 9--13, 2026, Jeju Island, Republic of Korea. ACM, New York, NY, USA, 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06906 2026-06-02 cs.SE cs.CR cs.DB cs.LG

MINES: Explainable Anomaly Detection through Web API Invariant Inference

MINES:通过Web API不变式推断实现可解释的异常检测

Wenjie Zhang, Yun Lin, Chun Fung Amos Kwok, Xiwen Teoh, Xiaofei Xie, Frank Liauw, Hongyu Zhang, Jin Song Dong

机构 * National University of Singapore(国立新加坡大学) Shanghai Jiao Tong University(上海交通大学) Singapore Management University(新加坡管理学院) GovTech Singapore(新加坡政府科技局) Chongqing University(重庆大学)

AI总结 提出MINES方法,通过从模式级别推断可解释的API不变式来检测Web应用异常,显著降低误报率并提高召回率。

Comments Accepted by ICSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16129 2026-06-02 cs.MA cs.AI cs.LG cs.RO

MARFT: Multi-Agent Reinforcement Fine-Tuning

MARFT: 多智能体强化微调

Junwei Liao, Muning Wen, Jun Wang, Weinan Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) OPPO Research Institute(OPPO研究院)

AI总结 针对基于大语言模型的多智能体系统,提出多智能体强化微调(MARFT)框架,通过引入Flex-MG马尔可夫博弈公式和通用算法,解决异步交互、异构架构等挑战,提升系统鲁棒性和适应性。

Comments 37 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09953 2026-06-02 cs.RO cs.AI

DAG-Plan: Generating Directed Acyclic Dependency Graphs for Dual-Arm Cooperative Planning

DAG-Plan:生成有向无环依赖图用于双臂协作规划

Zeyu Gao, Yao Mu, Jinye Qu, Mengkang Hu, Shijia Peng, Chengkai Hou, Lingyue Guo, Ping Luo, Shanghang Zhang, Yanfeng Lu

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences (CASIA)(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院(CASIA)) School of Artificial Intelligence, University of Chinese Academy of Sciences (UCAS)(中国科学院大学人工智能学院) School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,北京大学计算机科学学院) Department of Computer Science, The University of Hong Kong(香港大学计算机科学系) OpenGVLab, Shanghai AI Laboratory(上海人工智能实验室,OpenGVLab)

AI总结 提出DAG-Plan框架,首次使用有向无环图作为双臂协调的核心表示,通过一次LLM解析生成结构化DAG,实现自适应并行执行,在双臂厨房基准测试中成功率提升48%,执行效率提升84.1%。

Comments ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.00967 2026-06-02 cs.CV

Counterfactual Intervention Feature Transfer for Visible-Infrared Person Re-identification

反事实干预特征迁移用于可见光-红外行人重识别

Xulin Li, Yan Lu, Bin Liu, Yating Liu, Guojun Yin, Qi Chu, Jinyang Huang, Feng Zhu, Rui Zhao, Nenghai Yu

机构 * School of Information Science and Technology, University of Science and Technology of China(信息科学与技术学院,中国科学技术大学) Key Laboratory of Electromagnetic Space Information, Chinese Academy of Science(电磁空间信息重点实验室,中国科学院) School of Data Science, University of Science and Technology of China(数据科学学院,中国科学技术大学) SenseTime Research(商汤科技研究院) Qing Yuan Research Institute, Shanghai Jiao Tong University(青元研究院,上海交通大学)

AI总结 针对可见光-红外行人重识别中图模型泛化性差的问题,提出反事实干预特征迁移方法,通过同质与异质特征迁移减少模态不平衡,并利用反事实关系干预增强图拓扑结构的可靠性。

Comments Accepted by ECCV 2022

详情

展开后加载摘要…

URL PDF HTML 收藏