arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Shanghai Jiao Tong University(上海交通大学)

共收录 3167
2604.17827 2026-04-21 cs.CL

Learning to Seek Help: Dynamic Collaboration Between Small and Large Language Models

学习寻求帮助:小语言模型与大语言模型之间的动态协作

Hang Zeng, Xiangyu Liu, Yong Hu, Chaoyue Niu, Jiarui Zhang, Shaojie Tang, Fan Wu, Guihai Chen

机构 * Shanghai Jiao Tong University, Shanghai, China(上海交通大学) WeChat Tencent, Beijing, China(微信腾讯) State University of New York at Buffalo, New York, United States(纽约州立大学布法罗分校)

AI总结 本文提出动态协作框架,使小模型主动请求大模型进行多步推理,大模型提供适应性反馈,通过系统研究协作策略受模型能力与效率隐私约束的影响,实验表明动态策略优于静态流程和独立推理,并能稳健迁移至未见的大模型。

Comments 8 content pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07791 2026-04-21 cs.AI cs.LG

SEARL: Joint Optimization of Policy and Tool Graph Memory for Self-Evolving Agents

SEARL:自进化智能体中策略与工具图记忆的联合优化

Xinshun Feng, Xinhao Song, Lijun Li, Gongshen Liu, Jing Shao

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiaotong University(上海交通大学)

AI总结 SEARL通过构建结构化经验记忆实现策略与工具图记忆的联合优化,提升智能体在知识推理和数学任务中的实用性和效率。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06663 2026-04-21 cs.CV

PlanViz: Evaluating Planning-Oriented Image Generation and Editing for Computer-Use Tasks

PlanViz: 评估面向计算机使用任务的图像生成与编辑

Junxian Li, Kai Liu, Leyang Chen, Weida Wang, Zhixin Wang, Jiaqi Xu, Fan Li, Renjing Pei, Linghe Kong, Yulun Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) Huawei Technologies Ltd(华为技术有限公司)

AI总结 PlanViz旨在评估图像生成与编辑在计算机使用任务中的表现,通过设计日常生活中常见的子任务,如路线规划、工作图示和网页与UI显示,提出任务自适应评分体系PlanScore以评估生成图像的正确性、视觉质量和效率。

Comments The main part of our paper: PlanViz Code is at: https://github.com/lijunxian111/PlanViz Supplementary material is at: https://github.com/lijunxian111/PlanViz/releases/tag/v1

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05449 2026-04-21 cs.CV cs.AI

DisCa: Accelerating Video Diffusion Transformers with Distillation-Compatible Learnable Feature Caching

DisCa:通过与知识蒸馏兼容的可学习特征缓存加速视频扩散变换器

Chang Zou, Changlin Li, Yang Li, Patrol Li, Jianbing Wu, Xiao He, Songtao Liu, Zhao Zhong, Kailin Huang, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Tencent Hunyuan(腾讯文英) Xidian University(西安电子科技大学)

AI总结 本文提出一种与知识蒸馏兼容的可学习特征缓存机制,用于加速视频扩散变换器,通过轻量级可学习神经预测器提升高维特征演化过程的准确性,并采用保守的受限均值流方法实现更稳定无损的知识蒸馏,从而将加速边界推至11.8倍同时保持生成质量。

Comments 18 pages, 8 figures; cvpr2026 paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26721 2026-04-21 cs.AI cs.MM

MaLoRA: Gated Modality LoRA for Key-Space Alignment in Multimodal LLM Fine-Tuning

MaLoRA:基于关键空间对齐的门控模态LoRA

Xinhan Zheng, Huyu Wu, Xueting Wang, Duo Su, Haiyun Jiang

机构 * University of Science and Technology of China(中国科学技术大学) University of Chinese Academy of Sciences(中国科学院大学) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) Institute for Clarity in Documentation(文档清晰研究所) Inria Paris-Rocquencourt(巴黎-鲁维尔研究所) Rajiv Gandhi University(拉贾·甘地大学) Palmer Research Laboratories(帕勒实验室)

AI总结 本文提出MaLoRA,通过门控机制对齐多模态LLM微调中的关键空间,揭示文本偏见源于注意力键空间内在不匹配。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07143 2026-04-21 cs.CV

Are We Using the Right Benchmark: An Evaluation Framework for Visual Token Compression Methods

我们是否在使用正确的基准:视觉令牌压缩方法的评估框架

Chenfei Liao, Wensong Wang, Zichen Wen, Xu Zheng, Yiyu Wang, Haocong He, Yuanhuiyi Lyu, Lutao Jiang, Xin Zou, Yuqian Fu, Bin Ren, Linfeng Zhang, Xuming Hu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Shanghai Jiao Tong University(上海交通大学) Northeastern University(东北大学) Shanghai AI Laboratory(上海人工智能实验室) The Hong Kong University of Science and Technology(香港科技大学) MBZUAI

AI总结 本文通过实验证明现有基准含大量无关样本, downsampling能有效过滤样本,提出VTC-Bench框架以更公平评估视觉令牌压缩方法。

Comments Accepted by ACL2026 Main. Code: https://github.com/Chenfei-Liao/VTC-Bench; Project Page: https://chenfei-liao.github.io/VTC-Bench-Page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20751 2026-04-21 cs.CV

Pref-GRPO: Pairwise Preference Reward-based GRPO for Stable Text-to-Image Reinforcement Learning

Pref-GRPO:基于偏好奖励的GRPO用于稳定文本到图像强化学习

Yibin Wang, Zhimin Li, Yuhang Zang, Yujie Zhou, Jiazi Bu, Chunyu Wang, Qinglin Lu, Cheng Jin, Jiaqi Wang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Hunyuan, Tencent(腾讯文脉) Shanghai AI Lab(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出Pref-GRPO方法,通过偏好奖励机制提升文本到图像生成的稳定性,同时引入UniGenBench基准测试评估模型性能。

Comments Project Page: https://codegoat24.github.io/UnifiedReward/Pref-GRPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21545 2026-04-21 cs.RO

UniDomain: Pretraining a Unified PDDL Domain from Real-World Demonstrations for Generalizable Robot Task Planning

UniDomain:从真实世界演示中预训练一个统一的PDDL领域以实现可泛化的机器人任务规划

Haoming Ye, Yunxiao Xiao, Cewu Lu, Panpan Cai

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Beijing University of Posts and Telecommunications(北京邮电大学)

AI总结 UniDomain通过预训练统一的PDDL领域,结合机器人操作演示,实现可泛化的任务规划,实验显示其在零样本情况下任务成功率和计划优化度显著提升。

Comments Accepted at NeurIPS 2025

Journal ref Advances in Neural Information Processing Systems 38 (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17701 2026-04-21 cs.IT cs.AI math.IT

WISV: Wireless-Informed Semantic Verification for Distributed Speculative Decoding in Device-Edge LLM Inference

WISV:无线感知语义验证用于设备-边缘分布式推测解码

Zixuan Liu, Zhiyong Chen, Nan Xue, Shengkang Chen, Jiangchao Yao, Meixia Tao, Wenjun Zhang

机构 * Cooperative Medianet Innovation Center(联合中位网创新中心) Department of Electronic Engineering, Shanghai Jiao Tong University(上海交通大学电子工程系)

AI总结 本文提出WISV框架,通过通道感知语义接受策略优化分布式推测解码,提升接受长度和降低交互轮次,实验证明在设备边缘LLM推理中具有显著性能优势。

Comments submitted to IEEE Trans

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17312 2026-04-21 cs.LG cs.AI

A Survey of Reinforcement Learning for Large Language Models under Data Scarcity: Challenges and Solutions

面向大数据稀缺性的大型语言模型强化学习综述:挑战与解决方案

Zhiyin Yu, Yuchen Mou, Juncheng Yan, Junyu Luo, Chunchun Chen, Xing Wei, Yunhui Liu, Hongru Sun, Yuxing Zhang, Jun Xu, Yatao Bian, Ming Zhang, Wei Ye, Tieke He, Jie Yang, Guanjie Zheng, Zhonghai Wu, Bo Zhang, Lei Bai, Xiao Luo

机构 * Peking University(北京大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) National University of Singapore(新加坡国立大学) Nankai University(南开大学) Tongji University(同济大学) Nanjing University(南京大学) University of Wollongong(沃林根大学) Shanghai Jiao Tong University(上海交通大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

AI总结 本文综述了在数据稀缺条件下大型语言模型强化学习的挑战与解决方案,提出三级框架,梳理现有方法并分析其优劣,为高效强化学习提供理论基础。

Comments Accepted to ACL 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17277 2026-04-21 cs.LG cs.AI cs.ET physics.app-ph

Fully Analog Resonant Recurrent Neural Network via Metacircuit

通过元电路实现的全模拟共振递归神经网络

Zixin Zhou, Tianxi Jiang, Menglong Yang, Zhihua Feng, Qingbo He, Shiwu Zhang

机构 * Institute of Humanoid Robots, CAS Key Laboratory of Mechanical Behavior and Design of Materials, Department of Precision Machinery and Precision Instrumentation, University of Science and Technology of China(机器人研究院、材料力学行为与设计国家重点实验室、精密机械与精密仪器系、中国科学技术大学) State Key Laboratory of Mechanical System and Vibration, Shanghai Jiao Tong University(机械系统与振动国家重点实验室、上海交通大学)

AI总结 本文提出一种通过元电路架构实现的全模拟共振递归神经网络,利用共振特性实现时间信息处理,无需数字转换,展示了在触觉感知、语音识别和状态监测中的跨领域应用。

Comments 23 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05523 2026-04-21 cs.AI

Market-Bench: Benchmarking Large Language Models on Economic and Trade Competition

Market-Bench: 在经济与贸易竞争中评估大语言模型

Yushuo Zheng, Huiyu Duan, Zicheng Zhang, Yucheng Zhu, Xiongkuo Min, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

AI总结 本文提出Market-Bench,通过经济贸易竞争评估大语言模型在经济相关任务中的能力,发现LLM在竞争中表现差异显著,只有少数能持续获利。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08276 2026-04-21 cs.AI

ACE-Router: Generalizing History-Aware Routing from MCP Tools to the Agent Web

ACE-Router: 从MCP工具到智能体网络的历史感知路由泛化

Zhiyuan Yao, Zishan Xu, Yifu Guo, Zhiguang Han, Cheng Yang, Shuo Zhang, Weinan Zhang, Xingshan Zeng, Weiwen Liu

机构 * Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学) Huawei Technologies Co. Ltd(华为技术有限公司) Sun Yat-sen University(中山大学) Nanyang Technological University(南洋理工大学) Hangzhou Dianzi University(杭州电子科技大学)

AI总结 本文提出ACE-Router,通过依赖丰富的候选图合成多轮轨迹,训练出动态上下文理解的路由器,实现在大规模生态系统中的精准导航,实验显示其在MCP-Universe和MCP-Mark基准上表现优异,具备泛化性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04744 2026-04-21 cs.SD cs.AI

Semi-Supervised Diseased Detection from Speech Dialogues with Multi-Level Data Modeling

基于多级数据建模的语音对话中半监督疾病检测

Xingyuan Li, Mengyue Wu

机构 * X-LANCE Lab, School of Computer Science, Shanghai Jiao Tong University, Shanghai, China(X-LANCE实验室、计算机科学学院、上海交通大学、上海、中国)

AI总结 本文提出一种音频-only半监督学习框架,通过多粒度特征聚合提升医疗语音分析中弱监督学习的效果,实验表明其在少量标注数据下能取得接近全监督性能的成果。

Comments Accepted for publication as a Findings paper at the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03632 2026-04-21 eess.AS cs.AI cs.SD

ReStyle-TTS: Relative and Continuous Style Control for Zero-Shot Speech Synthesis

ReStyle-TTS:零样本语音合成中的相对和连续风格控制

Haitao Li, Chunxiang Jin, Chenglin Li, Wenhao Guan, Zhengxing Huang, Xie Chen

机构 * Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Ant Group(蚂蚁集团) Xiamen University(厦门大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 ReStyle-TTS通过Decoupled Classifier-Free Guidance和LoRAs实现连续且参考相关的风格控制,提升零样本语音合成的风格适应性与鲁棒性。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11391 2026-04-21 cs.LG

SPOT: Single-Shot Positioning via Trainable Near-Field Rainbow Beamforming

SPOT:通过可训练近场彩虹波束成形实现单次定位

Yeyue Cai, Jianhua Mo, Meixia Tao

机构 * Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出一种端到端深度学习方案,同时设计彩虹波束并估计用户位置,通过可训练变量提升定位精度,单次下行传输即可恢复用户角度-范围坐标,显著降低开销并提升定位精度。

Journal ref in IEEE Wireless Communications Letters, vol. 15, pp. 2094-2098, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19564 2026-04-21 cs.LG cs.AI

Bi-LoRA: Efficient Sharpness-Aware Minimization for Fine-Tuning Large-Scale Models

Bi-LoRA:高效锐度感知最小化用于大规模模型微调

Yuhang Liu, Tao Li, Zhehao Huang, Zuopeng Yang, Xiaolin Huang

机构 * Institute of Image Processing and Pattern Recognition, School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(图像处理与模式识别研究所,自动化与智能感知学院,上海交通大学) MoE Key Laboratory of System Control and Information Processing (Shanghai)(系统控制与信息处理MOE重点实验室(上海))

AI总结 Bi-LoRA通过引入辅助LoRA模块,有效解决传统SAM在LoRA参数上的限制,实现更高效的锐度优化,提升模型泛化能力。

Comments 32 pages,ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11281 2026-04-21 cs.CL cs.AI cs.CY

ToxiFrench: Benchmarking and Enhancing Language Models via CoT Fine-Tuning for French Toxicity Detection

ToxiFrench:通过CoT微调提升法语毒性检测的语言模型基准测试

Axel Delaval, Shujian Yang, Haicheng Wang, Han Qiu, Jialiang Lu

机构 * École Polytechnique(巴黎高等理工学院) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学)

AI总结 本文提出ToxiFrench数据集,通过半自动化标注流程构建,发现小语言模型在毒性检测任务中表现更优,并提出动态加权损失策略提升模型忠实度,Qwen3-4B模型在基准测试中取得最佳性能。

Comments 22 pages, 5 figures, 11 tables. This paper introduces TOXIFRENCH, a benchmark of 53,622 comments for French toxicity detection. It proposes a Chain-of-Thought fine-tuning method with a dynamic weighted loss. The fine-tuned 4B model (Qwen3-4B) achieves state-of-the-art performance, outperforming larger models like GPT-4o and DeepSeek-R1

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05075 2026-04-21 cs.LG cs.NA math.NA stat.ML

Discrepancies are Virtue: Weak-to-Strong Generalization through Lens of Intrinsic Dimension

差异是美德:通过内在维度视角实现弱到强的泛化

Yijun Dong, Yicheng Li, Yunai Li, Jason D. Lee, Qi Lei

机构 * New York University(纽约大学) Shanghai Jiaotong University(上海交通大学) Princeton University(普林斯顿大学)

AI总结 通过内在低维空间视角分析弱到强泛化,揭示强弱模型差异对泛化误差的正向影响,实验验证了在回归、视觉和NLP任务中的有效性。

Comments ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17065 2026-04-21 cs.CV

BasketHAR: A Multimodal Dataset for Human Activity Recognition and Sport Analysis in Basketball Training Scenarios

BasketHAR:一种用于篮球训练场景中的人体活动识别和运动分析的多模态数据集

Xian Gao, Haoyue Zhang, Zongyun Zhang, Jiacheng Ruan, Ting Liu, Yuzhuo Fu

机构 * Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出BasketHAR数据集,用于解决现有HAR数据集在体育分析应用中的不足,通过多模态数据包括运动传感器和视频记录,提供先进的HAR任务研究资源。

Comments 7 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17009 2026-04-21 cs.AI

Small Model as Master Orchestrator: Learning Unified Agent-Tool Orchestration with Parallel Subtask Decomposition

小模型作为主指挥者:通过并行子任务分解学习统一的智能体-工具协调

Wenzhen Yuan, Wutao Xiong, Fanchen Yu, Shengji Tang, Ting Liu, Tao Chen, Peng Ye, Yuzhuo Fu, Wanli Ouyang, Lei Bai

机构 * Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) Shanghai AI Lab(上海人工智能实验室) Sichuan University(四川大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出Agent-as-Tool框架,通过并行子任务分解和状态反馈提升多智能体系统协调效率,ParaManager在多个基准测试中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16943 2026-04-21 cs.CL

MNAFT: modality neuron-aware fine-tuning of multimodal large language models for image translation

MNAFT:多模态大语言模型的模态神经感知微调用于图像翻译

Bo Li, Ningyuan Deng, Tianyu Dong, Shaobo Wang, Shaolin Zhu, Lijie Wen

机构 * School of Computer Science and Technology, Tianjin University, Tianjin, China(天津大学计算机科学与技术学院) School of Software, Tsinghua University, Beijing, China(清华大学软件学院) School of Information Resource Management, Renmin University of China,Beijing, China(中国人民大学信息资源管理学院) School of Artificial Intelligence, Shanghai Jiao Tong University, Shanghai, China(上海交通大学人工智能学院) Baidu Inc., Beijing, China(百度公司)

AI总结 本文提出MNAFT,通过识别视觉和语言模块中语言无关和语言特定的神经元,改进多模态大语言模型在图像翻译中的表现,实验表明其优于现有方法。

Comments Accepted by SCIS (SCIENCE CHINA Information Science)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16896 2026-04-21 q-bio.QM cs.AI

ProtoCycle: Reflective Tool-Augmented Planning for Text-Guided Protein Design

ProtoCycle:基于反思的工具增强规划用于文本引导的蛋白质设计

Yutang Ge, Guojiang Zhao, Sihang Li, Zheng Cheng, Zifeng Zhao, Hanchen Xia, Guolin Ke, Linfeng Zhang, Zhifeng Gao, Yuguang Wang

机构 * Shanghai Jiao Tong University, School of Mathematical Sciences(上海交通大学数学科学学院) DP Technology(DP技术) University of Science and Technology of China(中国科学技术大学) AI for Science Institute(AI for Science研究院)

AI总结 本文提出ProtoCycle框架,通过LLM驱动的反馈循环和轻量级工具环境,提升文本引导蛋白质设计的序列质量。

Comments 25 pages, 11 figures. Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16886 2026-04-21 cs.RO

Chain Of Interaction Benchmark (COIN): When Reasoning meets Embodied Interaction

交互链基准(COIN):当推理遇见具身交互

Xianhao Wang, Xiaojian Ma, Haozhe Hu, Rongpeng Su, Yutian Cheng, Zhou Ziheng, Hangxin Liu, Lei Liu, Bin Li, Qing Li

机构 * University of Science and Technology of China(中国科学技术大学) Beijing Institute for General Artificial Intelligence (BIGAI)(北京通用人工智能研究院) Xidian University(西安电子科技大学) Shanghai Jiao Tong University(上海交通大学) University of California, Los Angeles(加州大学洛杉矶分校)

AI总结 COIN基准通过设计日常场景下的50个交互任务,评估机器人在部分可观测环境下进行因果依赖推理的能力,揭示现有方法在交互推理任务中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16471 2026-04-21 cs.LO cs.AI cs.IT cs.MA math.IT

Semantic Channel Theory: Deductive Compression and Structural Fidelity for Multi-Agent Communication

语义通道理论:多智能体通信的演绎压缩与结构保真

Jianfeng Xu

机构 * Koguan School of Law, China Institute for Smart Justice, School of Computer Science, Shanghai Jiao Tong University(柯关法学院,中国智能正义研究院,计算机科学学院,上海交通大学)

AI总结 本文提出语义通信的严谨框架,结合形式证明系统与香农理论工具,定义语义通道及四种递增语义深度的失真度量,通过显式Datalog实例验证了演绎压缩增益和语义瓶颈现象。

Comments arXiv admin note: text overlap with arXiv:2604.11204

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16391 2026-04-21 cs.RO cs.CV

Disentangled Robot Learning via Separate Forward and Inverse Dynamics Pretraining

通过分离前向和逆向动力学预训练实现解耦的机器人学习

Wenyao Zhang, Bozhou Zhang, Zekun Qi, Wenjun Zeng, Xin Jin, Li Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) Eastern Institute of Technology, Ningbo(宁波东部技术研究所) Shanghai Innovation Institute(上海创新研究院) Tsinghua University(清华大学)

AI总结 本文提出DeFI框架,通过分离前向和逆向动力学预训练,利用不同数据源解决视觉-动作耦合问题,实现端到端微调,实验表明在CALVIN ABC-D和SimplerEnv上取得最佳性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16312 2026-04-21 cs.IR cs.AI

FlexStructRAG: Flexible Structure-Aware Multi-Granular Relational Retrieval for RAG

FlexStructRAG: 一种灵活的结构感知多粒度关系检索方法用于RAG

Mengzhu Chen, Haodong Yang, Jia Cai, Xiaolin Huang

机构 * School of Statistics and Data Science, Guangdong University of Finance & Economics(广东金融学院统计与数据科学学院) Guangdong Provincial Key Laboratory of Public Finance and Taxation with Big Data Application, Guangdong University of Finance & Economics(广东省公共财政与税收大数据应用重点实验室,广东金融学院) Institute of Image Processing and Pattern Recognition, Shanghai Jiao Tong University(上海交通大学图像处理与模式识别研究所) MOE Key Laboratory of System Control and Information Processing, Shanghai Jiaotong University(教育部系统控制与信息处理重点实验室,上海交通大学)

AI总结 FlexStructRAG通过构建多粒度知识图谱和超图,实现灵活的关系检索,提升RAG系统的语义理解与生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22149 2026-04-21 cs.CL cs.AI

DynaWeb: Model-Based Reinforcement Learning of Web Agents

DynaWeb:基于模型的Web代理强化学习

Hang Ding, Peidong Liu, Junqiao Wang, Ziwei Ji, Meng Cao, Rongzhao Zhang, Lynn Ai, Eric Yang, Tianyu Shi, Lei Yu

机构 * Shanghai Jiao Tong University(上海交通大学) Sichuan University(四川大学) Hong Kong University of Science and Technology(香港科学与技术大学) McGill University(麦吉尔大学) Shanghai AI Lab(上海人工智能实验室) Gradient University of Toronto(多伦多大学) Mila - Quebec AI Institute(魁北克AI研究所)

AI总结 本文提出DynaWeb框架,通过模拟环境提升Web代理的强化学习效率,实验表明其在WebArena和WebVoyager基准上显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27462 2026-04-21 cs.CL cs.AI

VCORE: Variance-Controlled Optimization-based Reweighting for Chain-of-Thought Supervision

VCORE: 基于方差控制的优化重加权用于链式推理监督

Xuan Gong, Senmiao Wang, Hanbo Huang, Ruoyu Sun, Shiyu Liang

机构 * Shanghai Jiao Tong University(上海交通大学) Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳))

AI总结 VCORE通过将链式推理监督转化为约束优化问题,实现对token的自适应监督分配,提升大语言模型的推理泛化能力,在数学和编程基准测试中表现突出。

Comments Accepted to ACL2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15229 2026-04-21 cs.CL cs.AI cs.LG

VocabTailor: Dynamic Vocabulary Selection for Downstream Tasks in Small Language Models

VocabTailor: 小语言模型下游任务中的动态词汇选择

Hanling Zhang, Yayu Zhou, Tongcheng Fang, Zhihang Yuan, Guohao Dai, Wanli Ouyang, Yu Wang

机构 * The Chinese University of Hong Kong(香港中文大学) Infinigence AI Tsinghua University(清华大学) SLAI Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

AI总结 VocabTailor通过动态词汇选择框架减少小语言模型词汇相关组件的内存使用,结合静态与动态策略,实现高达99%的内存节省且不影响性能。

详情

展开后加载摘要…

URL PDF HTML 收藏