arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-25 至 2026-05-25 共收录 274 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 52 篇

2601.21198 2026-05-25 cs.DC cs.AI cs.LG 62%

ZipMoE: Efficient On-Device MoE Serving via Lossless Compression and Cache-Affinity Scheduling

ZipMoE:通过无损压缩和缓存亲和调度实现高效的设备端MoE服务

Yuchen Yang, Yaru Zhao, Pu Yang, Shaowei Wang, Zhi-Hua Zhou

机构 * School of Electronic Science and Engineering, Nanjing University, China.(南京大学电子科学与工程学院) National Key Laboratory for Novel Software Technology, Nanjing University, China.(南京大学新型软件技术国家重点实验室)

专题命中 效率与部署 :language model(abstract);分类 cs.AI、cs.LG

AI总结 提出ZipMoE系统,通过缓存-调度协同设计利用边缘设备硬件特性和MoE参数统计冗余,实现无损且高效的设备端MoE推理,显著降低延迟并提升吞吐量。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23198 2026-05-25 cs.LG 57%

Label-Efficient Dataset Pruning via Semi-Supervised Pseudo-Labeling

标签高效的数据集剪枝通过半监督伪标签

Yeseul Cho, Baekrok Shin, Changmin Kang, Chulhee Yun

机构 * Graduate School of AI, KAIST(人工智能研究生院,韩国科学技术院)

专题命中 效率与部署 :pretraining(abstract);分类 cs.LG

AI总结 提出 SemiPrune 框架,利用少量随机标注子集通过半监督学习生成伪标签,使监督剪枝方法可应用于未标注数据,基于伪标签训练动态估计样本难度并选择核心集,在领域特定、图像损坏和长尾数据集上达到最优性能。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04390 2026-05-25 cs.CR cs.AI 57%

Through the Stealth Lens: Attention-Aware Defenses Against Poisoning in RAG

通过隐秘视角:检索增强生成中针对投毒攻击的注意力感知防御

Sarthak Choudhary, Nils Palumbo, Ashish Hooda, Krishnamurthy Dj Dvijotham, Somesh Jha

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) ServiceNow Research(ServiceNow研究)

专题命中 效率与部署 :LLM(abstract_cn);分类 cs.AI

AI总结 针对检索增强生成系统在低污染率下仍易受投毒攻击的问题,提出基于注意力权重的归一化段落注意力分数和注意力方差滤波器,实现高精度检测与防御,并揭示真正隐秘投毒的挑战。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22937 2026-05-25 cs.CL 57%

RAS: Reflection-Augmented Scaling with In-Context Learning for Executable Cypher Query Generation

RAS: 基于上下文学习的反射增强缩放用于可执行Cypher查询生成

Minseok Jung, Abhas Ricky, Muhammad Rameez Chatni

机构 * Cloudera

专题命中 效率与部署 :language model(abstract);分类 cs.CL

AI总结 提出反射增强缩放(RAS)方法,利用执行错误反馈进行上下文学习,在Text2Cypher任务中显著降低查询执行错误率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20901 2026-05-25 cs.CV 50%

Benchmarking and Enhancing VLM for Compressed Image Understanding

基准测试与增强VLM对压缩图像的理解

Zifu Zhang, Tongda Xu, Siqi Li, Shengxi Li, Yue Zhang, Mai Xu, Yan Wang

机构 * Institute for AI Industry Research, Tsinghua University, Beijing, China(清华人工智能产业研究院) Beihang University, Beijing, China(北京航空航天大学) Beijing University of Technology, Beijing, China(北京理工大学)

专题命中 效率与部署 :language model(abstract)

AI总结 本文提出首个全面基准测试评估VLM对压缩图像的理解能力,分析性能差距来源,并设计通用适配器提升模型性能10%-30%。

Comments The paper is accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23523 2026-05-25 cs.CV 50%

ComPose: When to Trust Hands for Object Pose Tracking

ComPose:何时信任手部进行物体姿态跟踪

Jisu Shin, Junoh Lee, JunGyu Lee, Inhwan Bae, Dohyeon Lee, Hokyun Im, Youngwoon Lee, Hae-Gon Jeon

机构 * GIST(韩国信息科学与技术学院) Yonsei Univ.(延世大学) DGIST(国立地面空间技术研究所)

专题命中 效率与部署 :foundation model(abstract)

AI总结 提出ComPose框架,利用手部作为补充线索,结合基础模型中的物体和手部线索,在RGB视频中实现6DoF物体姿态跟踪,有效应对严重手部遮挡和几何模糊。

Comments 22 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23477 2026-05-25 cs.RO 50%

Semantically Structured Mixture-of-Experts for Compositional Robotic Manipulation

语义结构化混合专家用于组合机器人操作

Chengyu Deng, Guanqi Chen, Yizhou Chen, Zejia Liu, Zhiwen Ruan, Guanhua Chen, Jia Pan

机构 * The University of Hong Kong(香港大学) Southern University of Science and Technology(南方科技大学)

专题命中 效率与部署 :language model(abstract)

AI总结 提出语义结构化混合专家扩散策略(SMoDP),通过视觉语言模型标注的技能语义指导专家专业化,实现参数高效的多任务组合操作。

Comments Accepted to Robotics: Science and Systems (RSS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23428 2026-05-25 cs.CV cs.MM 50%

FAST-ME: Foundation-aware Adaptive Stopping for Motion Estimation for Efficient IoT Video Analysis

FAST-ME:面向高效物联网视频分析的基于基础模型的自适应运动估计停止方法

Kakia Panagidi, Stathes Hadjieftymiadis

机构 * Department of Informatics \& Telecommunications National Kapodistrian University of Athens Athens, Greece

专题命中 效率与部署 :foundation model(abstract)

AI总结 提出一种基于最优停止理论和基础模型(如ViT和SAM)的语义感知运动估计框架,通过融合语义注意力分数与失真度量实现自适应停止,在降低计算量的同时保持精度和语义覆盖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23373 2026-05-25 cs.SD 50%

AffectCodec: Emotion-Preserving Neural Speech Codec with Block-Diagonal Residual FSQ

AffectCodec: 具有块对角残差FSQ的情感保持神经语音编解码器

Zhaoyang Meng, Zhengyao Ma, Kecan Mao, Yingming Gao, Ya Li

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 效率与部署 :language model(abstract)

AI总结 针对神经语音编解码器在量化过程中丢弃情感线索的问题,提出基于块对角残差有限标量量化(BD-RFSQ)的AffectCodec,通过结构约束的量化实现情感保持,在低比特率下显著提升情感保留度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23281 2026-05-25 cs.CV 50%

DepthAgent: Towards Better Universal Depth Estimation via Sample-wise Expert Selection

DepthAgent: 通过样本级专家选择实现更好的通用深度估计

Jie Zhu, Girish Chandar Ganesan, Xiaoming Liu

机构 * Michigan State University(密歇根州立大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 效率与部署 :language agent(abstract)

AI总结 提出DepthAgent,一种视觉语言智能体,通过多轮工具调用和强化学习微调,自适应地为不同相机设置(透视、鱼眼、全景)选择或融合多个深度估计专家模型,显著提升通用深度估计性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23254 2026-05-25 cs.CV 50%

CARE: Class-Adaptive Expert Consensus for Reliable Learning with Long-Tailed Noisy Labels

CARE: 面向长尾噪声标签可靠学习的类别自适应专家共识

Mengke Li, Haiquan Ling, Lihao Chen, Yang Lu, Yiqun Zhang, Hui Huang

机构 * College of Computer Science and Software Engineering, Shenzhen University, Shenzhen, China.(深圳大学计算机科学与软件工程学院,中国深圳) Guangming Laboratory, Shenzhen, China.(深圳广明实验室,中国深圳) School of Informatics, Xiamen University, Xiamen, China.(厦门大学信息学院,中国厦门) School of Computer Science and Technology, Guangdong University of Technology, Guangzhou, China(广东工业大学计算机科学与技术学院,中国广州)

专题命中 效率与部署 :language model(abstract)

AI总结 提出CARE框架,利用视觉语言模型的三种互补监督源,通过类别自适应专家共识机制,根据类别频率对尾部类施加更严格的一致性、对头部类施加更宽松的一致性,以过滤不可靠信号并重新校准类别分布,从而在长尾噪声标签下实现可靠修正。

Comments poster in ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22272 2026-05-25 cs.RO cs.CV 50%

Imagine2Real: Towards Zero-shot Humanoid-Object Interaction via Video Generative Priors

Imagine2Real: 通过视频生成先验实现零样本人形机器人-物体交互

Jiahe Chen, ZiRui Wang, Feiyu Jia, Xiao Chen, Xiaojie Niu, Weishuai Zeng, Tianfan Xue, Xiaowei Zhou, Jiangmiao Pang, Jingbo Wang

机构 * Zhejiang University(浙江大学) Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学)

专题命中 效率与部署 :foundation model(abstract)

AI总结 提出Imagine2Real框架,利用视频生成先验和4D点轨迹统一表示,通过稀疏关键点跟踪和行为基础模型潜空间,实现零样本人形机器人-物体交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15828 2026-05-25 cs.CV 50%

Not All Tasks Quantize Equally: Fisher-Guided Quantization for Visual Geometry Transformer

并非所有任务量化平等:面向视觉几何Transformer的Fisher引导量化

Yipu Zhang, Jintao Cheng, Weilun Feng, Jiehao Luo, Chuanguang Yang, Zhulin An, Yongjun Xu, Wei Zhang

机构 * Department of Electronic and Computer Engineering, HKUST(香港科技大学电子与计算机工程系) State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院人工智能安全国家重点实验室) University of Chinese Academy of Sciences(中国科学院大学) School of Data Science and Engineering, South China Normal University(华南师范大学数据科学与工程学院)

专题命中 效率与部署 :post-training(abstract)

AI总结 提出Fisher引导量化方法,利用Fisher信息矩阵量化不同任务、块和通道的敏感性,在量化校准中保护关键通道和块,以解决前馈3D重建模型量化时任务间敏感性差异导致的精度损失问题。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 领域大模型 20 篇

2603.20630 2026-05-25 cs.SE cond-mat.mtrl-sci 89%

Evaluating LLM-generated code for domain-specific languages: molecular dynamics with LAMMPS

评估LLM生成的领域特定语言代码:使用LAMMPS进行分子动力学模拟

Ethan Holbrook, Juan C. Verduzco, Alejandro Strachan

专题命中 领域大模型 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出一种评估流程,结合标准化、解析、低成本执行和准确性检查,系统评估LLM为分子动力学代码LAMMPS生成输入文件的有效性,发现当前模型在科学准确性上有限,但通过可复用的智能体技能可显著提升。

Comments 19 pages, 5 figures, Supporting Info, 27 total pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23007 2026-05-25 q-fin.TR cs.AI cs.LG q-fin.PM 88%

MadEvolve: Evolutionary Optimization of Trading Systems with Large Language Models

MadEvolve: 基于大型语言模型的交易系统进化优化

Yurii Kvasiuk, Tianyi Li, Owen Colegrove, Moritz Münchmeyer

机构 * Department of Physics, University of Wisconsin–Madison(威斯康星大学麦迪逊分校物理系) Event Horizon Labs(事件地平线实验室)

专题命中 领域大模型 :large language model(title);language model(title);LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 提出 MadEvolve 框架,利用大型语言模型驱动的进化算法优化量化金融中的交易策略与 alpha 生成,以比特币交易为例,在特征集演化、策略组件优化及联合演化上取得显著改进,并对比了其他智能搜索方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22971 2026-05-25 cs.CL cs.HC 88%

Can AI Guess What You Know? Performance Comparison of Large Language Models for Human Domain Knowledge Estimation From Communication Logs

AI 能猜出你知道什么吗?从通信日志中估计人类领域知识的大型语言模型性能比较

Ko Watanabe, Shoya Ishimaru

机构 * Osaka Metropolitan University(大阪 metropolitan 大学)

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本研究通过分析 Slack 日志,比较了七种大型语言模型在零样本设置下估计用户领域知识的能力,发现 Gemini 2.5 Flash 误差最低(MAE 21.13%),且估计精度与消息量弱相关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06252 2026-05-25 cs.CR cs.AI cs.LG 88%

False Alarms, Real Damage: Adversarial Attacks Using LLM-based Models on Text-based Cyber Threat Intelligence Systems

虚假警报,真实损害:基于LLM的模型对文本网络威胁情报系统的对抗攻击

Samaneh Shafee, Alysson Bessani, Pedro M. Ferreira

机构 * Faculty of Sciences, University of Lisbon(里斯本大学科学学院) CIENCES, University of Lisbon(里斯本大学CIENCES)

专题命中 领域大模型 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 研究针对文本网络威胁情报(CTI)系统的对抗攻击,分析逃避、淹没和投毒三种攻击类型,重点展示对抗文本生成如何欺骗分类器、降低性能并破坏系统功能。

Journal ref Future Generation Computer Systems, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02688 2026-05-25 cond-mat.mtrl-sci cs.SE 87%

MatClaw: An Autonomous Code-First LLM Agent for End-to-End Materials Exploration

MatClaw: 一种用于端到端材料探索的自主代码优先LLM代理

Chenmu Zhang, Boris I. Yakobson

专题命中 领域大模型 :LLM(title,title_cn)

AI总结 提出MatClaw,一种代码优先的LLM代理,通过直接编写和执行Python代码、结合四层记忆架构和检索增强生成,实现多代码工作流在远程HPC集群上的自主运行,并在铁电CuInP2S6的三个端到端演示中验证了其可靠性,同时通过文献自学习和专家约束弥合隐性领域知识差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23676 2026-05-25 cs.HC 86%

AI at the Front Lines of Platform Governance: Using LLMs to Support Illegal Content Reporting under the Digital Services Act

平台治理前线的AI:利用大语言模型支持《数字服务法案》下的非法内容举报

Marie-Therese Sekwenz, Shreyan Biswas, Rita Hermann-Gsenger, Ujwal Gadiraju

专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本研究通过受控用户实验(N=450),比较了无辅助、传统可解释AI(XAI)和评估性AI(EvalAI)三种条件下,大语言模型辅助用户举报非法内容的效果,发现EvalAI在AI错误时提高了条款级准确性并减少了分类偏差,但两种AI均未显著提升用户解释质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22672 2026-05-25 cs.AI 85%

Is Capability a Liability? More Capable Language Models Make Worse Forecasts When It Matters Most

能力是负担吗?更强大的语言模型在关键时刻做出更差的预测

Nick Merrill, Jaeho Lee, Ezra Karger

机构 * Forecasting Research Institute(预测研究 institute)

专题命中 领域大模型 :language model(title);LLM(abstract,abstract_cn);post-training(abstract);分类 cs.AI

AI总结 本文发现,在时间序列呈现超线性增长和制度转换尾部风险的预测问题上,更强大的语言模型反而产生更差的分位数预测,并分析了这一逆缩放现象的机制、影响因素及评估指标问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23468 2026-05-25 eess.SP 85%

ComHymba: Low-Complexity Domain-Informed Foundation Model for Wireless Communications

ComHymba:面向无线通信的低复杂度领域信息基础模型

Bowen Yang, Wei Chen, Jiaming Cheng, Bo Ai

专题命中 领域大模型 :foundation model(title,abstract);LLM(abstract,abstract_cn)

AI总结 提出ComHymba,一种基于非对称掩码自编码器的领域信息无线基础模型,通过3D时空频补丁化、领域信息掩码策略和幅度-相位加权目标,结合Hymba块(窗口自注意力与状态空间模型融合),实现线性复杂度,在信道重建、感知和波束管理等任务上优于强基线且推理加速3.3倍。

Comments 13 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23472 2026-05-25 cs.CV 83%

Rethinking Transfer Learning for Industrial Inspection: DINOv3 vs. ImageNet Pretraining Across RGB and X-ray Tasks

重新思考工业检测的迁移学习:DINOv3与ImageNet预训练在RGB和X射线任务上的对比

Mehdi Gharbage, Céline Teulière, Pierre Bouges, Thierry Chateau

机构 * Michelin Tyres Manufacturer(米其林轮胎制造商) Université Clermont Auvergne, CNRS, Institut Pascal(克莱蒙特-奥弗涅大学,CNRS,帕西尔研究所)

专题命中 领域大模型 :pretraining(title,abstract);foundation model(abstract,comments)

AI总结 本研究通过对比ConvNeXt骨干网络在监督ImageNet分类和DINOv3蒸馏预训练下的表现,评估了现代自监督预训练在工业视觉检测中的有效性,发现DINOv3在RGB任务微调后表现更优,但在X射线模态下监督预训练仍更有效。

Comments Accepted to the CVPR 2026 Workshop on Vision Foundation Models for Industrial Inspection (VISION'26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21504 2026-05-25 q-fin.ST cs.AI 79%

Multivariate Financial Forecasting using the Chronos Time Series Foundation Models

使用Chronos时间序列基础模型进行多元金融预测

Sanjiv R Das, Tarang Goyal, Mohini Yadav

机构 * Santa Clara University(圣克拉拉大学)

专题命中 领域大模型 :foundation model(title,abstract);分类 cs.AI

AI总结 本文利用Chronos-2开源时间序列基础模型,评估多元输入相对于单变量基线在金融预测中的准确性提升,发现多元预测一致优于单变量,尤其在利率和股票市场中表现显著。

Comments 10 pages, 3 tables, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11629 2026-05-25 cs.LG 79%

GP2F: Cross-Domain Graph Prompting with Adaptive Fusion of Pre-trained Graph Neural Networks

GP2F: 基于预训练图神经网络自适应融合的跨域图提示学习

Dongxiao He, Wenxuan Sun, Yongqi Huang, Jitao Zhao, Di Jin

机构 * School of Computer Science and Technology, Tianjin University, Tianjin, China(天津大学计算机科学与技术学院,天津,中国)

专题命中 领域大模型 :prompting(title,abstract);分类 cs.LG

AI总结 针对跨域图提示学习中预训练知识与任务特定适应性的互补机制,提出双分支自适应融合方法GP2F,通过对比损失和拓扑一致性损失实现拓扑约束下的自适应融合,在跨域少样本节点和图分类任务上优于现有方法。

Comments 16 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23787 2026-05-25 cs.CY cs.HC 75%

Engagement-Optimized Care: When LLMs become Mental Health Infrastructure

优化参与的护理:当LLM成为心理健康基础设施

Briana Vecchione, Meryl Ye, Livia Garofalo, Ranjit Singh

专题命中 领域大模型 :LLM(title_cn,abstract_cn)

AI总结 本研究通过定性纵向研究,揭示通用LLM因护理缺口被用作心理健康支持,其以参与度而非用户福祉为导向的设计导致结构性不公平权衡,并提出了设计问责制。

Comments 10 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23024 2026-05-25 cs.AI cs.CC cs.CL cs.LG 75%

The Deterministic Horizon: Impossibility Results as Design Specifications for Trustworthy AI Systems

确定性视界:作为可信AI系统设计规范的不可行性结果

Dongxin Guo

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过证明架构决定的准确率上限、偏好学习的样本复杂度跳跃、多阶段检索的指标数量要求等16个不可行性结果,将计算极限转化为可信AI系统的设计规范。

Comments PhD thesis, Department of Computer Science, The University of Hong Kong, 2026. 271 pages, 18 figures, 15 tables, 5 algorithms

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23320 2026-05-25 cs.AI 70%

Human-in-the-Loop Multi-Agent Ventilator Decision Support with Contextual Bandit Preference Learning

人在回路的多智能体呼吸机决策支持与上下文赌博机偏好学习

Sijia Li, Xiaoyu Tan, Qixing Wang, Weiyi Zhao, Chen Zhan, Teqi Hao, Xuemin Wang, Lei Gu, Roland Eils, Xihe Qiu

机构 * Shanghai University of Engineering Science, Shanghai, China Tencent Youtu Lab, Tencent, China Department of Critical Care Medicine, Shanghai Tenth People's Hospital, Tongji University School of Medicine, Shanghai, China Department of Emergency Critical Disease, Songjiang Hospital Affiliated to Shanghai Jiao Tong University School of Medicine, Shanghai, China Max Planck Institute for Heart Lung Research, Bad Nauheim, Germany Fudan University, Shanghai, China BIH at Charit\'e -- Universit\"atsmedizin Berlin, Berlin, Germany

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出VDSS框架,通过人在回路的多智能体协作和上下文赌博机在线偏好适应,实现呼吸机决策支持的个性化与可审计性。

Comments miccai 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18911 2026-05-25 cs.LG cs.AI 62%

Does Your Wildfire Prediction Model Actually Work, or Just Score Well?

你的野火预测模型真的有效,还是只是得分高?

Yangshuang Xu, Yuyang Dai, Liling Chang, Qi Wang, Yushun Dong

机构 * Florida State University(佛罗里达州立大学) Northeastern University(东北大学)

专题命中 领域大模型 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 针对现有地球基础模型不专门用于野火预测的问题,提出首个专门预训练的野火基础模型WILDFIRE-FM,并引入固定合约评估框架以解决评估设计对结论敏感性的问题。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13473 2026-05-25 cs.AI 57%

NeuroWeaver: An Autonomous Evolutionary Agent for Exploring the Programmatic Space of EEG Analysis Pipelines

NeuroWeaver:一种用于探索EEG分析流水线程序空间的自主进化智能体

Guoan Wang, Shihao Yang, Jun-En Ding, Feng Liu

机构 * Department of Systems Engineering, Stevens Institute of Technology(系统工程系,斯蒂文斯理工学院)

专题命中 领域大模型 :foundation model(abstract);分类 cs.AI

AI总结 针对EEG分析中基础模型计算成本高和通用自动机器学习缺乏神经科学先验的问题,提出NeuroWeaver自主进化智能体,通过领域信息子空间初始化和多目标进化优化,在五个异构基准上合成轻量级解决方案,性能优于现有任务特定方法并接近大规模基础模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07919 2026-05-25 cs.CV 50%

MedVIGIL: Evaluating Trustworthy Medical VLMs Under Broken Visual Evidence

MedVIGIL: 在视觉证据受损下评估可信的医学视觉语言模型

Hanqi Jiang, Junhao Chen, Mingyu Kang, Hyeokjae Kwon, Yi Pan, Lifeng Chen, Weihang You, Haozhen Gong, Ruiyu Yan, Jinglei Lv, Lin Zhao, Hui Ren, Quanzheng Li, Tianming Liu, Xiang Li

机构 * University of Georgia(佐治亚大学) Harvard Medical School(哈佛医学院) Chungbuk National University(Chungbuk国立大学) Chungnam National University Hospital(Chungnam国立大学医院) National University of Singapore(新加坡国立大学) New York University(纽约大学) University of Sydney(悉尼大学) New Jersey Institute of Technology(新泽西理工学院)

专题命中 领域大模型 :language model(abstract)

AI总结 本文提出MedVIGIL基准,通过300例由放射科医生监督构建的扰动证据测试集,评估医学视觉语言模型在视觉证据失效时的可靠性,并引入MedVIGIL复合评分(MCS)进行审计。

详情

展开后加载摘要…

URL PDF HTML 收藏