arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Nanjing University(南京大学)

共收录 1176
2606.21933 2026-06-23 cs.SD 新提交

ISCSLP 2026 CoT-TTS Challenge: Chain-of-Thought Reasoning for Context-Aware Text-to-Speech

ISCSLP 2026 CoT-TTS挑战赛:面向上下文感知文本转语音的思维链推理

Wei Xue, Junlan Feng, Shilei Zhang, Yue Wang, Ruosong Yang, Bei Liu, Liumeng Xue, Sitong Cheng, Jiahao Pan, Weizhen Bian, Boyi Kang, Bin Long

机构 * The Hong Kong University of Science and Technology(香港科技大学) China Mobile(中国移动) Jiutian Artificial Intelligence Technology (Beijing) Co., Ltd., China Mobile(九天人工智能技术(北京)有限公司,中国移动) China Mobile (Hong Kong) Innovation Research Institute(中国移动(香港)创新研究院) Nanjing University(南京大学)

AI总结 针对现有可控TTS系统难以自动推断复杂对话场景中说话方式的问题,提出CoT-TTS挑战赛,要求系统从上下文推断说话方式并生成语音,包含文本和音频两个赛道,采用思维链推理和语音波形输出。

Comments 11 pages, ISCSLP 2026 challenge proposal

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21929 2026-06-23 cs.LG 新提交

Selective Ensemble Based on Preference-Directed Multi-Objective Bandits

基于偏好导向的多目标赌博机的选择性集成

Lanjihong Ma, Zhen-Yu Zhang, Masashi Sugiyama, Zhi-Hua Zhou

机构 * Department of Computer Science, Zhejiang Gongshang University(浙江工商大学计算机科学与技术学院) Center for Advanced Intelligence Project, RIKEN(日本理化学研究所先进智能研究中心) Graduate School of Frontier Sciences, The University of Tokyo(东京大学新领域创成科学研究科) National Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) School of Artificial Intelligence, Nanjing University(南京大学人工智能学院)

AI总结 针对有限评估预算下部分偏好指定的选择性集成问题,形式化为偏好导向多目标赌博机,提出PrefUCB算法,实现对数遗憾界,在预训练模型集成和资产分配中验证有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21687 2026-06-23 cs.LG 新提交

Expressivity Saturation: Reduced Affine Region Usage Under Increasing Task Complexity

表达性饱和:任务复杂度增加下仿射区域使用减少

Xuan Qi, Yi Wei, Fanqi Yu, Manuel Lecha

机构 * Istituto Italiano di Tecnologia(意大利技术研究院) University of Genoa(热那亚大学) Nanjing University(南京大学)

AI总结 本文研究了分段仿射神经网络中理论区域容量与训练后实际区域使用之间的差距,发现随着任务复杂度增加,训练后网络使用的仿射区域显著减少,称为表达性饱和,并分析了其对决策边界的影响。

Journal ref Transactions on Machine Learning Research, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21559 2026-06-23 cs.CL 新提交

Rubric-as-Experts: Case-Specific MQM Rubrics for Translation Quality Evaluation

Rubric-as-Experts: 面向翻译质量评估的案例特定MQM评分标准

Weilu Xu, Yunzhi Shen, Xinye Wang, Ranfei Dang, Shujian Huang

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室)

AI总结 提出案例特定动态评分标准框架,根据翻译实例自适应选择MQM子类型空间和评估粒度,在WMT跨度级QE基准上提升MCC并减少误报。

Comments 18 pages including appendix, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20736 2026-06-23 cs.CV 新提交

REKEY: Metadata-Grounded Visual-Key Regeneration for Contamination-Resilient VQA Evaluation

REKEY: 基于元数据的视觉键再生方法用于抗污染的VQA评估

Tengjie Lin, Yutao Sun, Jingwei Ni, Shuhan Ge, Hao-Xuan Ma, Yanting Miao, Wangyue Lu, Mingshuai Chen, Tiancheng Zhao, Jianwei Yin

机构 * Zhejiang University(浙江大学) ETH Zürich(苏黎世联邦理工学院) Nanjing University of Science and Technology(南京理工大学) Nanjing University(南京大学) University of Waterloo(滑铁卢大学) Binjiang Institute of Zhejiang University(浙江大学滨江研究院)

AI总结 提出ReKey协议,通过随机再生图像中的视觉键来防止VQA基准测试泄露,实验显示原始项目得分比再生变体高9.5-18.8个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23676 2026-06-23 cs.LG cs.AI math.OC stat.ML 新提交

Open Problem: Is AdamW Effective Under Heavy-Tailed Noise?

开放问题:AdamW 在重尾噪声下是否有效?

Dingzhi Yu, Hongyi Tao, Yuanyu Wan, Luo Luo, Lijun Zhang

机构 * Nanjing University(南京大学) Zhejiang University(浙江大学) Fudan University(复旦大学)

AI总结 本文提出开放问题:AdamW 在重尾噪声下能否收敛?通过加权度量基准和走廊下界机制,揭示分母记忆可能隐藏大梯度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18774 2026-06-23 cs.LG 新提交

RouteJudge: An Open Platform for Reproducible and Preference-Aware LLM Routing

RouteJudge: 一个可复现且偏好感知的LLM路由开放平台

Guannan Lai, Haoran Hu, Han-Jia Ye

机构 * School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) National Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) SinapisAI

AI总结 提出RouteJudge平台,通过匿名成对比较评估LLM路由策略的决策质量,并发布ORBIT工具箱标准化路由工作流,支持可复现和偏好感知的路由评估。

Comments Accepted by Pluralistic Alignment Workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13912 2026-06-23 cond-mat.dis-nn cond-mat.str-el cs.LG physics.comp-ph quant-ph 新提交

Low-variance estimators overcome the phase-gradient bottleneck in complex-valued neural quantum states

具有复杂相位结构的神经网络量子态的直接/自适应混合相位梯度学习

Yi-Ran Xue, Rui Wang, Baigeng Wang, Chenan Wei

机构 * National Laboratory of Solid State Microstructures and Department of Physics(固体-state微结构国家实验室和物理系) Department of Physics, University of Massachusetts(麻省大学物理系) A. Alikhanyan National Science Laboratory(Alikhanyan国家科学实验室) Collaborative Innovation Center of Advanced Microstructures, Nanjing University(先进微结构协同创新中心,南京大学) Jiangsu Physical Science Research Center(江苏物理科学研究中心) Hefei National Laboratory(合肥国家实验室)

AI总结 针对神经网络量子态在复杂相位结构下的优化脆弱性问题,提出直接相位梯度估计器与自适应混合方法,显著降低方差并提升精度,在100位点通量梯子和手性XXX链上验证了优势。

Comments 38 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22713 2026-06-23 cs.LG 版本更新

Non-Adversarial Imitation Learning Provably Free of Compounding Errors: The Value Flow Mechanism

非对抗模仿学习无复合误差的理论保证:价值流机制

Tian Xu, Chenyang Wang, Xiaochen Zhai, Ziniu Li, Yi-Chen Li, Yang Yu

机构 * National Key Laboratory for Novel Software Technology(新型软件技术国家实验室) School of Artificial Intelligence, Nanjing University, China(南京大学人工智能学院) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shenzhen Research Institute of Big Data(深圳大数据研究院)

AI总结 本文证明IQ-Learn等价于行为克隆,存在复合误差,并提出基于Bellman约束的Dual Q-DM方法,通过价值流传播实现非对抗模仿学习,理论上消除复合误差。

Comments Paper accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14275 2026-06-23 eess.AS cs.AI cs.SD 版本更新

Controllable Accent Normalization via Discrete Diffusion

通过离散扩散实现可控口音标准化

Qibing Bai, Yuhan Du, Tom Ko, Shuai Wang, Yannan Wang, Haizhou Li

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Nanjing University(南京大学) Tencent Ethereal Audio Lab(腾讯虚音频实验室) Shenzhen Loop Area Institute(深圳河套学院)

AI总结 提出DLM-AN系统,利用掩蔽离散扩散和自监督语音令牌,通过选择性重用源令牌控制口音强度,结合流匹配时长比预测器调整节奏,实现低词错误率和可解释的口音强度控制。

Comments Accepted to Interspeech 2026 as a long paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12691 2026-06-23 cs.RO cs.AI 版本更新

ALOE: Action-Level Off-Policy Evaluation for Vision-Language-Action Model Post-Training

ALOE: 面向视觉-语言-动作模型后训练的动作级离策略评估

Rushuai Yang, Hecheng Wang, Zhichao Wu, Chiming Liu, Xiaohan Yan, Xuan Du, Shuoyu Yue, Chuheng Zhang, Yunlong Wang, Yongcheng Liu, Lizhe Qi, Yi Chen, Wei Shan, Maoqing Yao

机构 * AgiBot The Hong Kong University of Science and Technology(香港科技大学) Fudan University(复旦大学) Nanjing University(南京大学) Independent Researcher(独立研究者)

AI总结 提出ALOE框架,通过离策略评估直接估计当前策略的价值,结合分块时序差分和保守值聚合,改善稀疏奖励下的信用分配,在四项真实世界操作任务中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13864 2026-06-23 cs.CR cs.AI 版本更新

HardSecBench: Benchmarking the Security Awareness of LLMs for Hardware Code Generation

HardSecBench: 对大型语言模型在硬件代码生成中的安全意识的基准测试

Qirui Chen, Jingxian Shuai, Shuangwu Chen, Shenghao Ye, Zijian Wen, Xufei Su, Jie Jin, Jiangming Li, Jun Chen, Xiaobin Tan, Jian Yang

机构 * University of Science and Technology of China(中国科学技术大学) Xi’an Jiaotong University(西安交通大学) Nanjing University(南京大学) ZTE Corporation(中兴通讯)

AI总结 提出HardSecBench基准,包含924个任务覆盖Verilog RTL和固件C代码,评估LLM在硬件代码生成中的安全性,发现模型常满足功能需求但存在安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22645 2026-06-23 cs.CV cs.AI 版本更新

HERMAN: Hierarchical Representation Matching for CLIP-based Class-Incremental Learning

HERMAN: 基于CLIP的类增量学习中的层次表示匹配

Zhen-Hao Xie, Yan Wang, Lan Li, Han-Jia Ye, De-Chuan Zhan, Da-Wei Zhou

机构 * School of Artificial Intelligence and the State Key Laboratory for Novel Software Technology, Nanjing University(人工智能学院和新型软件技术国家重点实验室,南京大学)

AI总结 提出HERMAN方法,利用LLM递归生成判别性文本描述,匹配不同语义层次并自适应路由,解决CLIP在类增量学习中的灾难性遗忘问题,在多个基准上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10703 2026-06-23 cs.CL cs.IR 版本更新

LatentCRS: A Variational EM Framework for Bridging Semantics and Behavior in LLM-based Conversational Recommendation

LatentCRS:一种用于桥接基于LLM的对话推荐中语义与行为的变分EM框架

Guanrong Li, Kuo Tian, Jinnan Qi, Qinghan Fu, Zhen Wu, Rui Xia, Xinyu Dai

机构 * Nanjing University(南京大学)

AI总结 提出LatentCRS框架,通过变分EM过程桥接LLM的语义空间与用户行为模式,解决对话推荐中语义理解与推荐精度不匹配的问题,实验表明其有效提升推荐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19857 2026-06-19 cs.CL cs.AI 新提交

Large Language Models Do Not Always Need Readable Language

大型语言模型并不总是需要可读语言

Jiayi Zhu, Haoxuan Peng, Junxi Wang, Liang Ke, Chen Zhang, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) The University of Sydney(悉尼大学) Hefei University of Technology(合肥工业大学) Xi’an Jiaotong University(西安交通大学) Nanjing University(南京大学)

AI总结 研究提出BabelTele表示法,将语义编码为紧凑、非标准文本,牺牲人类可读性但保持LLM可恢复性,实验表明可压缩至27.9%长度并保持99.5%语义保真度,降低上下文开销。

Comments 23 pages, 10 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19776 2026-06-19 cs.CV 新提交

Occ-VLM: Occupancy Grounded Vision Language Model for Indoor Scene Understanding

Occ-VLM: 面向室内场景理解的占用接地视觉语言模型

Jianing Li, Zhou Fang, Yijiang Liu, Li Du

机构 * School of Electronic Science and Engineering, Nanjing University(南京大学电子科学与工程学院)

AI总结 提出Occ-VLM,仅用姿态RGB图像和单一2D视觉编码器,通过重建3D占用作为几何先验,实现统一的3D场景理解,在占用预测、3D VQA和密集描述任务上达到领先水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19658 2026-06-19 cs.AI cs.IR cs.MM 新提交

Denoising Implicit Feedback for Cold-start Recommendation

去噪隐式反馈用于冷启动推荐

Gaode Chen, Shicheng Wang, Shikun Li, Rui Huang, Xinghua Zhang, Yunze Luo, Shipeng Li, Shiming Ge, Ruina Sun, Yinjie Jiang, Jun Zhang

机构 * Hong Kong Baptist University(香港浸会大学) Independent Researcher(独立研究员) Peking University(北京大学) Nanjing University(南京大学) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)

AI总结 针对冷启动推荐中隐式反馈噪声问题,提出模型无关的去噪方法DIF,通过内容相似性推断伪标签并建模置信度与不确定性,在快手应用中显著提升冷启动场景商业指标。

Comments Accepted by KDD 2026 ADS Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17006 2026-06-19 cs.CV cs.RO 版本更新

CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning

CoMo: 从互联网视频中学习连续潜在运动以实现可扩展的机器人学习

Jiange Yang, Yansong Shi, Haoyi Zhu, Mingyu Liu, Kaijing Ma, Yating Wang, Gangshan Wu, Tong He, Limin Wang

机构 * Nanjing University(南京大学) Shanghai AI Lab(上海人工智能实验室) University of Science and Technology of China(中国科学技术大学) Zhejiang University(浙江大学) Fudan University(复旦大学) Tongji University(同济大学)

AI总结 提出CoMo方法,通过早期时间差分和时序对比学习从互联网视频中学习连续潜在运动,避免离散化信息损失,实现零样本泛化生成伪动作标签,联合训练策略在仿真和真实实验中表现优异。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19002 2026-06-18 cs.CL 新提交

Enhancing Multilingual Reasoning via Steerable Model Merging

通过可引导的模型合并增强多语言推理

Zhuoran Li, Rui Xu, Jian Yang, Junnan Liu, Zhijun Chen, Qianren Mao, Hongcheng Guo, Jiaheng Liu, Likang Xiao, Ming Li, Xiaojie Wang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Fudan University(复旦大学) Beihang University(北京航空航天大学) Monash University(墨尔本大学) Zhongguancun Laboratory(中关村实验室) Nanjing University(南京大学) Tsinghua University(清华大学)

AI总结 提出可引导模型合并(ST-Merge)框架,通过门控交叉注意力机制自适应调节源模型贡献,在多语言推理任务中优于强基线。

Comments 12 pages, 7 figures, 8 tables. Accepted by ACL2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18644 2026-06-18 cs.CV 新提交

Spiking Pyramid Wavelet Transformation for High-efficient and Low-energy Image Restoration

尖峰金字塔小波变换用于高效低能耗图像恢复

Chen Zhao, Xiantao Hu, Song Wu, Qian Wang, Chen Wu, Rui Xie, Jian Yang, Ying Tai

机构 * Nanjing University(南京大学) Nanjing University of Science and Technology(南京理工大学) University of Science and Technology of China(中国科学技术大学) China Mobile Institute(中国移动研究院)

AI总结 提出基于尖峰神经网络和金字塔小波变换的SPWM模型,通过SDPW块建模长程依赖并利用小波域退化特性,在保持图像质量的同时显著降低计算和能耗。

Comments Accepted by Pattern Recognition

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18192 2026-06-18 cs.AI 新提交

The Stanford EDGAR Filings Dataset: Reconstructing U.S. Corporate and Financial Disclosures into Layout-Faithful and Token-Efficient Pretraining Data

斯坦福EDGAR文件数据集:将美国公司及财务披露重建为布局忠实且令牌高效的预训练数据

Nick Bettencourt, Xiaowei Ding, Kay Giesecke

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Nanjing University(南京大学) Stanford University(斯坦福大学)

AI总结 为解决长上下文文档稀缺问题,提出SEFD数据集,将SEC文件重建为布局忠实的MultiMarkdown格式,用于金融语言建模与评估,具有令牌高效、与Common Crawl重叠率低于0.1%的特点。

Comments Preprint. Includes appendix, tables, and figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14702 2026-06-18 cs.CV 新提交

OmniVideo-100K: A Dataset for Audio-Visual Reasoning through Structured Scripts and Evidence Chains

OmniVideo-100K:通过结构化脚本和证据链进行音视频推理的数据集

Xinyue Cai, Chaoyou Fu, Yi-Fan Zhang, Ran He, Caifeng Shan

机构 * Nanjing University(南京大学) CASIA(中国科学院自动化研究所)

AI总结 提出OmniVideo-100K数据集,通过实体锚定视频脚本和线索引导的QA生成机制,解决音视频问答中跨段实体不一致和长时推理不足的问题,微调模型在多个基准上取得显著提升。

Comments Project page: https://github.com/MiG-NJU/OmniVideo-100K

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01139 2026-06-18 cs.AI 版本更新

SkillRevise: Improving LLM-Authored Agent Skills via Trace-Conditioned Skill Revision

SkillRevise: 通过轨迹条件技能修订改进LLM撰写的智能体技能

Yuxuan Liu, Zhaochen Su, Lingyun Xie, Yuhao Zhang, Qing Zong, Jiahe Guo, Zhongwei Xie, Yiyan Ji, Yauwai Yim, Hongyu Luo, Xiyu Ren, Ruan Chenyu, Haoran Li, Yangqiu Song

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Harbin Institute of Technology(哈尔滨工业大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Nanjing University(南京大学) The University of Hong Kong(香港大学)

AI总结 提出SkillRevise框架,通过执行证据诊断、修复原则检索和执行锚定编辑,迭代优化初始技能,在SkillsBench上将基础智能体成功率从36.05%提升至61.63%,并展现跨模型迁移性。

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28076 2026-06-18 cs.CL cs.AI cs.LG 版本更新

TopBench: A Benchmark for Implicit Predictive Reasoning in Tabular Question Answering

TopBench:表格问答中隐式预测推理的基准

An-Yang Ji, Jun-Peng Jiang, De-Chuan Zhan, Han-Jia Ye

机构 * School of Artificial Intelligence, Nanjing University, China(人工智能学院,南京大学,中国) National Key Laboratory for Novel Software Technology, Nanjing University, China(新型软件技术国家重点实验室,南京大学,中国)

AI总结 提出TopBench基准,包含779个样本和四个子任务,评估大语言模型在表格问答中识别隐式预测意图并进行可靠推理的能力,发现当前模型在意图识别上存在困难。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00026 2026-06-18 cs.CL cs.AI cs.IR 版本更新

ActMem: Bridging the Gap Between Memory Retrieval and Reasoning in LLM Agents

ActMem:弥合LLM代理中记忆检索与推理之间的差距

Xiaohui Zhang, Zequn Sun, Chengyuan Yang, Yaqin Jin, Yazhong Zhang, Wei Hu

机构 * State Key Laboratory for Novel Software Technology, Nanjing University, China(南京大学新型软件技术国家重点实验室) Alibaba Group, Hangzhou, China(阿里巴巴集团,杭州,中国) National Institute of Healthcare Data Science, Nanjing University, China(南京大学健康数据科学国家研究院)

AI总结 提出ActMem框架,通过将非结构化对话历史转化为结构化因果语义图,结合反事实推理和常识补全,实现主动因果推理,显著提升LLM代理在复杂记忆依赖任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18132 2026-06-17 cs.AI 新提交

Knowledge Reutilization in Meta-Reinforcement Learning

元强化学习中的知识复用

Yuan Meng, Bo Wang, Juan de los Rios Ruiz, Xiangtong Yao, Zhenshan Bing, Fuchun Sun, Alois Knoll

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系)

AI总结 提出一种元知识复用框架,通过动力学简化智能体学习任务知识并迁移至异构智能体,利用贝叶斯非参数先验和高层策略生成任务级指导,显著降低跟踪误差并提高样本效率。

Comments 18 pages initial submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17648 2026-06-17 cs.AI 新提交

From Brewing to Resolution: Tracing the Internal Lifecycle of Code Reasoning in LLMs

从酝酿到解析:追踪LLM中代码推理的内部生命周期

Siyue Chen, Yifu Guo, Yuquan Lu, Zishan Xu, Jiaye Lin, Jianbo Lin, Siyu Zhang, Cheng Yang, Junxin Li, Yujia Li, Yu Huo, Ruixuan Wang

机构 * South China University of Technology(华南理工大学) Sun Yat-sen University(中山大学) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) Nanjing University(南京大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Hangzhou Dianzi University(杭州电子科技大学) Guangzhou College of Technology and Business(广州工商学院)

AI总结 提出双重诊断框架(逐层线性探针与上下文剥离解码),揭示LLM在代码推理中先酝酿答案后进入四种解析结果(已解析、过度处理、错误解析、未解析)的内部生命周期,发现酝酿支架稳定而解析成功随能力变化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15932 2026-06-17 cs.CL 新提交

Beyond NL2Code: A Structured Survey of Multimodal Code Intelligence

超越NL2Code:多模态代码智能的结构化综述

Xuanle Zhao, Qiushi Sun, Jingyu Xiao, Xuexin Liu, Haoyue Yang, Qiaosheng Chen, Xianzhen Luo, Jing Huang, Yufeng Zhong, Lei Chen, Shuai Fu, Zhenlin Wei, Jinhe Bi, Lei Jiang, Haibo Qiu, Siqi Yang, Peng Shi, Jian Hu, Zhixiong Zeng

机构 * Meituan(美团) The University of Hong Kong(香港大学) The Chinese University of Hong Kong(香港中文大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Nanjing University(南京大学) Harbin Institute of Technology(哈尔滨工业大学) Australian Institute for Machine Learning, Adelaide University(阿德莱德大学澳大利亚机器学习研究所) Ludwig Maximilian University of Munich(慕尼黑大学) University of Science and Technology of China(中国科学技术大学) Queen Mary University of London(伦敦玛丽女王大学)

AI总结 本文系统综述多模态代码智能,将任务按代码角色分类,覆盖GUI、科学可视化、结构化图形及前沿任务,并提出四个基于验证的未来方向。

Comments Work completed in January 2026. Updating now

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04990 2026-06-17 cs.CR cs.AI 版本更新

From Agent Traces to Trust: A Survey of Evidence Tracing and Execution Provenance in LLM Agents

从智能体痕迹到信任:LLM智能体中的证据追踪与执行溯源

Yiqi Wang, Jiaqi Zhang, Taotao Cai, Zirui Liu, Qingqiang Sun, Zequn Sun, Zhangkai Wu, Manqing Dong, Mingkai Zheng, Xuefei Yin, Yanming Zhu

机构 * Griffith University(格里菲斯大学) Jiangsu University(江苏大学) University of Southern Queensland(南方昆士兰大学) Peking University(北京大学) Great Bay University(大湾大学) Nanjing University(南京大学) Macquarie University(麦觉瑞大学) Southern University of Science and Technology(南方科学与技术大学)

AI总结 本文系统综述了LLM智能体中的证据追踪与执行溯源方法,通过统一溯源视角连接检索、工具使用、记忆等环节,提出分类体系并讨论开放挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20708 2026-06-17 cs.CV cs.AI 版本更新

Rethinking Cross-Layer Information Routing in Diffusion Transformers

重新思考扩散变换器中的跨层信息路由

Chao Xu, Maohua Li, Qirui Li, Yixuan Xu, Yanke Zhou, Yunhe Li, Cuifeng Shen, Hanlin Tang, Kan Liu, Tao Lan, Lin Qu, Shao-Qun Zhang

机构 * Nanjing University(南京大学) Alibaba Group(阿里巴巴集团) Zhejiang University(浙江大学) City University of Hong Kong(香港城市大学)

AI总结 本文研究了扩散变换器中跨层信息流动的问题,通过系统性的实证分析,识别了传统残差加法的三个具体症状,并提出了扩散适应性路由(DAR)方法,以实现可学习、时间步适应和非递增的子层输出聚合,从而提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏