arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Shanghai Jiao Tong University(上海交通大学)

共收录 3178
2511.22924 2026-02-03 cs.MA cs.AI cs.CR

MAS-Shield: A Defense Framework for Secure and Efficient LLM MAS

MAS-Shield: 一种用于安全高效LLM MAS的防御框架

Kaixiang Wang, Zhaojiacheng Zhou, Bunyod Suvonov, Jiong Lou, Jie LI

机构 * Shanghai Jiaotong University(上海交通大学)

AI总结 MAS-Shield通过粗到细的过滤流程,结合关键智能体选择、轻量审计和全局共识审计,实现安全高效防御LLM多智能体系统语言攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20295 2026-02-03 cs.CV

FAST: Foreground-aware Diffusion with Accelerated Sampling Trajectory for Segmentation-oriented Anomaly Synthesis

FAST: 前景感知扩散与加速采样轨迹用于面向分割的异常合成

Xichen Xu, Yanshu Wang, Jinbao Wang, Xiaoning Lei, Guoyang Xie, Guannan Jiang, Zhichao Lu

机构 * Global Institute of Future Technology, Shanghai Jiao Tong University, Shanghai, China(上海交通大学未来技术全球研究院) School of Artificial Intelligence, Shenzhen University, Shenzhen, China(深圳大学人工智能学院) Department of Intelligent Manufacturing, CATL, Ningde, China(CATL智能制造部门) Department of Computer Science, City University of Hong Kong, Hong Kong, China(香港城市大学计算机科学系)

AI总结 FAST提出一种前景感知扩散框架,通过AIAS和FARM模块提升工业异常合成效率与质量,实现更可控的结构特定异常生成。

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23361 2026-02-03 cs.SE cs.CL cs.LG

SWE-Exp: Experience-Driven Software Issue Resolution

SWE-Exp:基于经验的软件问题解决

Silin Chen, Shaoxin Lin, Yuling Shi, Heng Lian, Xiaodong Gu, Longfei Yun, Dong Chen, Lin Cao, Jiyang Liu, Nu Xia, Qianxiang Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Huawei(华为) Xidian University(西安电子科技大学)

AI总结 SWE-Exp通过提炼历史经验实现软件问题解决的持续学习,显著提升修复效率。

Comments Our code and data are available at https://github.com/YerbaPage/SWE-Exp

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01274 2026-02-03 cs.CL cs.AI

PACER: Blockwise Pre-verification for Speculative Decoding with Adaptive Length

PACER:基于自适应长度的块级预验证用于推测解码

Situo Zhang, Yifan Zhang, Zichen Zhu, Hankun Wang, Da Ma, Danyang Zhang, Lu Chen, Kai Yu

机构 * X-LANCE Lab, School of Computer Science MoE Key Lab of Artificial Intelligence, SJTU AI Institute Shanghai Jiao Tong University(X-LANCE实验室,计算机科学学院,人工智能关键实验室,上海交通大学人工智能研究院)

AI总结 Pacer通过自适应长度的块级预验证技术,提升推测解码效率,实现高达3.09倍的加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01202 2026-02-03 cs.AI

Workflow-R1: Group Sub-sequence Policy Optimization for Multi-turn Workflow Construction

Workflow-R1: 多轮工作流构建的分组子序列策略优化

Mingze Kong, Zikun Qu, Zhongquan Zhou, Pengyu Liang, Xiang Li, Zhiwei Shang, Zhi Hong, Kaiyu Huang, Zhiyong Wang, Zhongxiang Dai

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shanghai Jiao Tong University(上海交通大学) Tianjin University(天津大学) Tongji University(同济大学) University of Edinburgh(爱丁堡大学)

AI总结 Workflow-R1通过分组子序列策略优化提升多轮工作流构建的灵活性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01037 2026-02-03 cs.CV cs.AI

VEQ: Modality-Adaptive Quantization for MoE Vision-Language Models

VEQ: 适用于MoE视觉-语言模型的模态自适应量化

Guangshuo Qin, Zhiteng Li, Zheng Chen, Weihang Zhang, Linghe Kong, Yulun Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学)

AI总结 VEQ通过模态自适应量化方法提升MoE视觉-语言模型的压缩性能,实现更高的准确率和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00800 2026-02-03 cs.LG cs.AI

JTok: On Token Embedding as another Axis of Scaling Law via Joint Token Self-modulation

JTok: 关于通过联合令牌自调制实现另一种扩展法则的令牌嵌入

Yebin Yang, Huaijin Wu, Fu Guo, Lin Yao, Xiaohan Qin, Jingzhi Wang, Debing Zhang, Junchi Yan

机构 * School of AI, Shanghai Jiao Tong University(人工智能学院,上海交通大学) Hi Lab, Xiaohongshu Inc(小红书研究院)

AI总结 JTok通过引入令牌索引参数,实现模型容量与计算资源的解耦,显著提升下游任务性能并减少计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00559 2026-02-03 cs.CV cs.AI

Learning to Decode Against Compositional Hallucination in Video Multimodal Large Language Models

在视频多模态大语言模型中学习对抗组合性幻觉

Wenbin Xing, Quanxing Zha, Lizheng Zu, Mengran Li, Ming Li, Junchi Yan

机构 * Sun Yat-sen University(中山大学) Huaqiao University(华侨大学) Shenzhen University(深圳大学) Guangming Laboratory(光明实验室) Shanghai Jiao Tong University(上海交通大学)

AI总结 针对视频多模态大语言模型中的组合性幻觉问题,提出TriCD框架,通过对比解码和三路径校准机制提升模型在对抗幻觉时的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00557 2026-02-03 cs.RO

ConLA: Contrastive Latent Action Learning from Human Videos for Robotic Manipulation

ConLA:从人类视频中通过对比学习学习机器人操作

Weisheng Dai, Kai Lan, Jianyi Zhou, Bo Zhao, Xiu Su, Junwen Tong, Weili Guan, Shuo Yang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) State Key Laboratory of Mobile Network and Mobile Multimedia Technology, Shenzhen(移动网络与移动多媒体技术国家重点实验室(深圳)) ZTE Corporation(中兴通讯) Shanghai Jiao Tong University(上海交通大学) Central South University(中南大学)

AI总结 ConLA通过对比学习从人类视频中学习机器人操作,有效解决潜在表示中的捷径学习问题,提升机器人学习的可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00500 2026-02-03 cs.RO

Inject Once Survive Later: Backdooring Vision-Language-Action Models to Persist Through Downstream Fine-tuning

一次注入,后期存活:向视觉-语言-动作模型注入后门以在下游微调中持续存在

Jianyi Zhou, Yujie Wei, Ruichen Zhen, Bo Zhao, Xiaobo Xia, Rui Shao, Xiu Su, Shuo Yang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Harbin Institute of Technology(哈尔滨工业大学) Meituan Academy of Robotics Shenzhen, Meituan(美团机器人深圳研究院) Shanghai Jiaotong University(上海交通大学) National University of Singapore(新加坡国立大学) Central South University(中南大学)

AI总结 本文提出INFUSE框架,首次实现对VLA模型的后门攻击,使其在用户微调后仍能保持有效性,显著提升攻击成功率并保持任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21915 2026-02-03 cs.CV

VideoAesBench: Benchmarking the Video Aesthetics Perception Capabilities of Large Multimodal Models

VideoAesBench: 大规模多模态模型视频审美感知能力评估基准

Yunhao Li, Sijing Wu, Zhilin Gao, Zicheng Zhang, Qi Jia, Huiyu Duan, Xiongkuo Min, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室)

AI总结 VideoAesBench通过多样化视频内容和多类型问题评估大规模多模态模型的视频审美感知能力,揭示当前模型在该领域的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19149 2026-02-03 cs.LG q-bio.QM

GPCR-Filter: a deep learning framework for efficient and precise GPCR modulator discovery

GPCR-Filter: 一种用于高效且精确发现GPCR调节剂的深度学习框架

Jingjie Ning, Xiangzhen Shen, Li Hou, Shiyi Shen, Jiahao Yang, Junrui Li, Hong Shan, Sanan Wu, Sihan Gao, H. Eric Xu, Xinheng He

机构 * The State Key Laboratory of Drug Research, Shanghai Institute of Materia Medica, Chinese Academy of Sciences, Shanghai, China(中国科学院上海药物研究所国家药物研究重点实验室) School of Computer Science, Carnegie Mellon University, Pittsburgh, PA 15213, USA(卡内基梅隆大学计算机科学学院) College of Computer Science and Electronic Engineering, Hunan University, Changsha, Hunan(湖南大学计算机科学与电子工程学院) Lingang Laboratory, Shanghai, China(上海灵冈实验室) Research Center for Medicinal Structural Biology, National Research Center for Translational Medicine at Shanghai, State Key Laboratory of Medical Genomics, Ruijin Hospital, Shanghai Jiao Tong University School of Medicine, Shanghai, China(上海 translational 医学研究中心,国家医学基因组学重点实验室,瑞金医院,上海交通大学医学院,上海,中国) School of Pharmacy, Fudan University, Shanghai 201203, China(复旦大学药学院)

AI总结 GPCR-Filter通过深度学习框架高效精准发现GPCR调节剂,结合蛋白质语言模型和图神经网络,实现对受体-配体功能关系的学习,提升药物开发效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06356 2026-02-03 cs.LG cs.AI q-bio.BM

Reaction Prediction via Interaction Modeling of Symmetric Difference Shingle Sets

通过对称差鳞片集的交互建模进行反应预测

Runhan Shi, Letian Chen, Gufeng Yu, Yang Yang

机构 * AGI Institute, School of Computer Science, Shanghai Jiao Tong University(AGI研究院,计算机科学学院,上海交通大学)

AI总结 ReaDISH通过引入对称差鳞片编码和几何-结构交互注意力机制,提升了反应预测的鲁棒性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11104 2026-02-03 cs.CL cs.AI

Enhancing LLM Reasoning via Non-Human-Like Reasoning Path Preference Optimization

通过非人类样式推理路径偏好优化增强大语言模型推理

Junjie Lu, Yuliang Liu, Chaofeng Qu, Wei Shen, Zhouhan Lin, Chuheng Zhang, Min Xu

机构 * University of Technology Sydney(悉尼技术大学) Shanghai Innovation Institute(上海创新研究院) Southeast University(东南大学) Microsoft Research(微软研究院) Nanjing University(南京大学) Shanghai Jiao Tong University(上海交通大学) Independent Researcher(独立研究者)

AI总结 本文提出CGPO方法,通过置信度信号优化推理路径,提升大语言模型在代码和数学推理任务中的性能。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26281 2026-02-03 cs.CV cs.AI

Point2RBox-v3: Self-Bootstrapping from Point Annotations via Integrated Pseudo-Label Refinement and Utilization

Point2RBox-v3: 通过集成伪标签细化和利用实现点标注的自举学习

Teng Zhang, Ziqian Fan, Mingxin Liu, Xin Zhang, Xudong Lu, Wentong Li, Yue Zhou, Yi Yu, Xiang Li, Junchi Yan, Xue Yang

机构 * Shanghai Jiao Tong University(上海交通大学) South China University of Technology(华南理工大学) Nankai University(南开大学) The Chinese University of Hong Kong(香港中文大学) Nanjing University of Aeronautics and Astronautics(南京航空航天大学) East China Normal University(华东师范大学) Ohio State University(俄亥俄州立大学)

AI总结 Point2RBox-v3通过集成伪标签细化和利用,实现了点标注的自举学习,有效提升稀疏和密集场景下的检测性能。

Comments 19pages, 5figures, 6tables

Journal ref The Fourteenth International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14391 2026-02-03 cs.CL cs.AI

Hallucination-Resistant Relation Extraction via Dependency-Aware Sentence Simplification and Two-tiered Hierarchical Refinement

通过依赖感知句子简化和双层级层次精炼实现抗幻觉的关系抽取

Yupei Yang, Fan Feng, Lin Yang, Wanxi Deng, Lin Qu, Biwei Huang, Shikui Tu, Lei Xu

机构 * Shanghai Jiao Tong University(上海交通大学) University of California San Diego(加州大学圣地亚哥分校) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Alibaba Group(阿里巴巴集团)

AI总结 DEPTH通过依赖感知句子简化和双层级层次精炼提升关系抽取的准确性,将幻觉率降低至7.9%,F1分数提升9.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01945 2026-02-03 cs.CL

LFQA-E: Carefully Benchmarking Long-form QA Evaluation

LFQA-E: 仔细评估长形式问答评测

Yuchen Fan, Chen Lin, Xin Zhong, Shuo Zhang, Heng Zhou, Yuchen Zhang, Mingyu Liang, Chengxing Xie, Ermo Hua, Gang Chen, Zhizhou He, Cheng Huang, Ning Ding, Bowen Zhou

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Lab(上海人工智能实验室) Tsimnghua University(塔密纳大学) Beijing University of Posts and Telecommunications(北京邮电大学) Zhejiang University(浙江大学) University of Tokyo(东京大学)

AI总结 LFQA-E是一个多语言、基于参考的长形式问答评测基准,用于严格评估自动指标的性能,揭示现有指标在捕捉长回答信息方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23180 2026-02-02 cs.LG

TriSpec: Ternary Speculative Decoding via Lightweight Proxy Verification

TriSpec: 通过轻量级代理验证实现三元推测解码

Haoyun Jiang, Junqi He, Feng Hong, Xinlong Yang, Jianwei Zhang, Zheng Li, Zhengyang Zhuge, Zhiyong Chen, Bo Han, Junyang Lin, Jiangchao Yao

机构 * CMIC, Shanghai Jiao Tong University(上海交通大学计算机学院) Qwen Team, Alibaba Group(阿里巴巴集团Qwen团队) Hong Kong Baptist University(香港 Baptist大学)

AI总结 TriSpec通过引入轻量级代理验证机制,有效降低推测解码的验证成本,实现高达35%的加速并减少50%的目标模型调用次数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22905 2026-02-02 cs.LG

FlexLoRA: Entropy-Guided Flexible Low-Rank Adaptation

FlexLoRA: 基于熵的灵活低秩适应

Muqing Liu, Chongjie Si, Yuheng Jia

机构 * Chien-Shiung Wu College, Southeast University(陈希ung Wu学院,东南大学) MoE Key Lab of Artificial Intelligence, AI Institute, School of Computer Science, Shanghai Jiao Tong University(人工智能MOE实验室,人工智能研究院,上海交通大学计算机科学学院) School of Computer Science and Engineering, Southeast University(计算机科学与工程学院,东南大学) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University), Ministry of Education, China(新一代人工智能技术及其跨学科应用关键实验室(东南大学),教育部,中国)

AI总结 FlexLoRA通过基于熵的灵活低秩适应框架,解决PEFT中粒度、灵活性和稳定性问题,实现性能提升。

Comments 2026 ICLR. Codes in https://github.com/Chongjie-Si/Subspace-Tuning

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04753 2026-02-02 cs.CL

EtCon: Edit-then-Consolidate for Reliable Knowledge Editing

EtCon:编辑后整合以实现可靠的知识编辑

Ruilin Li, Yibin Wang, Wenhong Zhu, Chenglin Li, Jinghao Zhang, Chenliang Li, Junchi Yan, Jiaqi Wang

机构 * Wuhan University(武汉大学) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学) University of Science and Technology of China(中国科学技术大学)

AI总结 EtCon通过编辑后整合范式提升LLMs的知识编辑可靠性与现实应用能力,保留预训练能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26852 2026-02-02 cs.AI cs.CL

CATArena: Evaluating Evolutionary Capabilities of Code Agents via Iterative Tournaments

CATArena: 通过迭代竞技场评估代码代理的进化能力

Lingyue Fu, Xin Ding, Linyue Pan, Yaoming Zhu, Shao Zhang, Lin Qiu, Weiwen Liu, Weinan Zhang, Xuezhi Cao, Xunliang Cai, Jiaxin Ding, Yong Yu

机构 * Shanghai Jiao Tong University, Shanghai, China(上海交通大学) Shenzhen International Graduate School, Tsinghua University, Shenzhen, China(清华大学深圳国际 Graduate School)

AI总结 CATArena通过迭代竞技场评估代码代理的进化能力,揭示了代理在连续优化和多轮迭代开发中的潜力及改进机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.03129 2026-02-02 cs.CV cs.AI cs.CL cs.LG

ARB-LLM: Alternating Refined Binarizations for Large Language Models

ARB-LLM: 交替精炼二值化用于大语言模型

Zhiteng Li, Xianglong Yan, Tianao Zhang, Haotong Qin, Dong Xie, Jiang Tian, zhongchao shi, Linghe Kong, Yulun Zhang, Xiaokang Yang

机构 * Shanghai Jiao Tong University(上海交通大学) ETH Zürich(苏黎世联邦理工学院) Lenovo Research(联想研究院)

AI总结 ARB-LLM通过交替精炼二值化技术,有效解决LLM二值化中的分布偏移和列偏差问题,实现性能超越现有SOTA方法。

Comments The code and models will be available at https://github.com/ZHITENGLI/ARB-LLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22667 2026-02-02 cs.SE cs.AI

From Horizontal Layering to Vertical Integration: A Comparative Study of the AI-Driven Software Development Paradigm

从水平分层到垂直整合:一种由AI驱动的软件开发范式比较研究

Chi Zhang, Zehan Li, Ziqian Zhong, Haibing Ma, Dan Xiao, Chen Lin, Ming Dong

机构 * China Creative Studies Institute(中国创意研究学院) Shanghai Zhongqiao Vocational and Technical University(上海仲桥职业技术大学) Shanghai Jiaotong University(上海交通大学)

AI总结 本文研究了AI驱动的软件开发范式转变,发现垂直整合可大幅降低资源消耗,并提出人机协作效能作为组织优化的新目标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22575 2026-02-02 cs.CV cs.CL

PhoStream: Benchmarking Real-World Streaming for Omnimodal Assistants in Mobile Scenarios

PhoStream:面向移动场景的多模态助手实时流基准测试

Xudong Lu, Huankang Guan, Yang Bo, Jinpeng Chen, Xintong Guo, Shuhan Li, Fang Liu, Peiwen Sun, Xueying Li, Wei Zhang, Xue Yang, Rui Liu, Hongsheng Li

机构 * CUHK MMLab(CUHK 多模态实验室) Huawei Research(华为研究) City University of Hong Kong(城市大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 PhoStream是首个面向移动场景的多模态助手实时流基准测试,通过统一屏幕内外场景评估视频、音频和时间推理能力,揭示了大语言模型在决定何时发言上的局限性。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22517 2026-02-02 cs.RO

RoboStriker: Hierarchical Decision-Making for Autonomous Humanoid Boxing

RoboStriker: 为自主人形 boxing 的分层决策

Kangning Yin, Zhe Cao, Wentao Dong, Weishuai Zeng, Tianyi Zhang, Qiang Zhang, Jingbo Wang, Jiangmiao Pang, Ming Zhou, Weinan Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院) Peking University(北京大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))

AI总结 RoboStriker通过分层三阶段框架实现自主人形拳击,结合动作跟踪学习与潜在空间正则化,提升竞争性能和现实迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22512 2026-02-02 cs.LG

DRL-Enabled Trajectory Planing for UAV-Assisted VLC: Optimal Altitude and Reward Design

基于深度强化学习的无人机辅助可见光通信轨迹规划:最优高度与奖励设计

Tian-Tian Lin, Yi Liu, Xiao-Wei Tang, Yunmei Shi, Yi Huang, Zhongxiang Wei, Qingqing Wu, Yuhan Dong

机构 * Department of Information and Communication Engineering, Tongji University(信息与通信工程系,同济大学) Department of Electronic Engineering, Shanghai Jiao Tong University(电子工程系,上海交通大学) Shenzhen International Graduate School, Tsinghua University(深圳国际研究生院,清华大学)

AI总结 本文提出基于深度强化学习的无人机辅助可见光通信轨迹规划方法,通过优化无人机飞行高度和奖励机制,显著提高数据收集效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22397 2026-02-02 cs.LG cs.DC

SAIR: Cost-Efficient Multi-Stage ML Pipeline Autoscaling via In-Context Reinforcement Learning

SAIR:通过基于上下文的强化学习实现高效的多阶段机器学习管道自动扩展

Jianchang Su, Yifan Zhang, Shengkai Lin, Shizhen Zhao, Yusheng Zheng, Yiwei Yang, Wei Zhang

机构 * University of Connecticut(康涅狄格大学) Shanghai Jiao Tong University(上海交通大学) University of California, Santa Cruz(加州大学圣克ruz分校)

AI总结 SAIR通过基于上下文的强化学习实现多阶段机器学习管道的高效自动扩展,显著提升P99延迟性能并降低资源成本

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22181 2026-02-02 cs.CL

MrRoPE: Mixed-radix Rotary Position Embedding

MrRoPE: 混基 radix 旋转位置嵌入

Qingyuan Tian, Wenhong Zhu, Xiaoran Liu, Xiaofeng Wang, Rui Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学)

AI总结 MrRoPE通过混合基数转换策略,统一了RoPE扩展方法,实现了无需微调的长序列泛化,提升了编码长度上限和检索准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10691 2026-02-02 cs.CL cs.AI

Evaluating from Benign to Dynamic Adversarial: A Squid Game for Large Language Models

从温和到动态对抗的评估:一个大型语言模型的鱿鱼游戏

Zijian Chen, Wenjun Zhang, Guangtao Zhai

机构 * Shanghai Jiao Tong University, Shanghai, China(上海交通大学) Shanghai AI Laboratory, Shanghai, China(上海人工智能实验室)

AI总结 本文提出鱿鱼游戏,一个动态对抗性评估环境,用于评估大型语言模型的多方面能力,并揭示静态基准中可能存在的评估范式污染问题。

Comments 31 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09139 2026-02-02 cs.CV

MACEval: A Multi-Agent Continual Evaluation Network for Large Models

MACEval: 一种用于大型模型的多智能体持续评估网络

Zijian Chen, Yuze Sun, Yuan Tian, Wenjun Zhang, Guangtao Zhai

机构 * Shanghai Jiao Tong University, Shanghai, China(上海交通大学) Shanghai AI Laboratory, Shanghai, China(上海人工智能实验室)

AI总结 MACEval通过多智能体持续评估网络,提出新的度量标准以动态评估大型模型,减少评估开销并提升评估效率。

Comments 32 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏