arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 2678 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 964 篇

2607.15394 2026-07-20 cs.LG 新提交 57%

A Transportable Threshold-Based Framework for Interpretable Classification of Medical Data

一种基于阈值的可移植框架用于医学数据的可解释分类

Antony Garcia, Adrian Noriega, Gabrielle Britton, Xinming Huang

机构 * Worcester Polytechnic Institute(伍斯特理工学院) Centro de Vacunación e Investigación (CEVAXIN)(疫苗接种与研究中心(CEVAXIN)) Universidad Tecnológica de Panamá(巴拿马技术大学) Massachusetts Institute of Technology(麻省理工学院) Broad Institute of MIT and Harvard(麻省理工学院和哈佛大学布罗德研究所) McGill University(麦吉尔大学) The Montreal Neurological Hospital-Institute(蒙特利尔神经学医院研究所)

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

AI总结 研究针对医学数据分类中黑箱模型的问题,引入基于统计学的框架,用伯努利朴素贝叶斯模型并结合\(\chi^2\)引导的统计二值化方法,在多数据集上评估,性能与复杂模型相当,还提供可解释规则和校准风险估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15202 2026-07-17 cs.AI cs.HC cs.MA cs.MM 新提交 57%

Self-Evolving Human-Centered Framework for Explainable Depression Symptom Annotation

用于可解释抑郁症症状标注的自我进化以人为中心框架

Hoang-Loc Cao, Van Pham, Truong Thanh Hung Nguyen, Phuc Truong Loc Nguyen, Phuc Ho, Veronica Whitford, Hung Cao

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 针对抑郁症标注质量瓶颈,提出结合大语言模型辅助与专家验证的自我进化标注框架,分三阶段运行,采用双记忆架构,能提高标注一致性和可解释性,减少人工修订,还输出多种信息实现可审计性。

Comments Accepted at IEEE International Conference on Omni-Layer Intelligent Systems (COINS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15051 2026-07-17 cs.CY 新提交 57%

SCITUS: A Multi-Jurisdictional Framework for Adapting NIST AI RMF to the Canadian Regulatory Context

SCITUS:将美国国家标准与技术研究院人工智能风险管理框架(NIST AI RMF)适配到加拿大监管环境的多辖区框架

Mohammad Etemad

专题命中 安全评测 :trustworthy(abstract);分类 cs.CY

AI总结 针对加拿大人工智能监管碎片化问题,提出SCITUS框架,它能将NIST AI RMF 1.0同时适配到加联邦和省级法规,整合多种要素,通过多场景展示适用性,为多辖区合规提供了更优模式及可复制模型。

Comments 74 pages, 1 figure. SCITUS Framework v2.0 (July 2026). Framework documentation: https://scitus.ca/scitus-framework

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14791 2026-07-17 cs.AI 新提交 57%

Transcoders for Investigating Deception in Language Models

用于研究语言模型中欺骗行为的转码器

Darius Lim, Nathan Leow, Xin Wei Chia

机构 * Home Team Science & Technology Agency (HTX)(新加坡内政部科技局)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 研究用转码器分析语言模型欺骗行为,通过预训练转码器的Qwen3 - 4B模型构建归因图,经特征引导和电路分析识别相关特征字典,发现欺骗源于模型内部机制,凸显转码器在监测及检测语言模型安全漏洞方面的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14591 2026-07-17 cs.CL 新提交 57%

How Well Does AI-Generated Feedback Work? Intrinsic and Extrinsic Evaluation across more than 20,000 EFL Essay Drafts

人工智能生成的反馈效果如何?对20000多篇外语作文草稿的内在和外在评估

Steven Coyne, Diana Galvan-Sosa, Ryan Spring, Machi Shimmei, Michael Zock, Keisuke Sakaguchi, Kentaro Inui

机构 * Tohoku University(东北大学) RIKEN(理化学研究所) ALTA Institute, Computer Laboratory, University of Cambridge(剑桥大学ALTA研究所,计算机实验室) CNRS, LIS, Aix-Marseille University(法国国家科学研究中心,艾克斯-马赛大学语言信息处理实验室) MBZUAI(Mohamed bin Zayed大学人工智能学院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 研究外语写作中人工智能生成的书面纠正性反馈效果,通过大学外语班级近2000名学生的超20000篇草稿,从教师内在评估和学生外在反馈两角度评估,发现传统专家评估与学生反馈一致性低,强调以学习者为中心评估框架的重要性。

Comments Pre-review version of DOI https://doi.org/10.1007/978-3-032-29788-4_35, presented at AIED 2026 Late Breaking Results. Readers are encouraged to refer to the published version

Journal ref AIED CCIS 3031 (2026) 247-253

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14479 2026-07-17 cs.CY 新提交 57%

BioTIER: A Refusal Benchmark for Targeted Biological Risk Mitigation

BioTIER:用于针对性生物风险缓解的拒绝基准

Eleanor M. Marshall, Pedro Medeiros, Peter Peneder, Nelly Mak, Jacob Kaffey, Faith Rovenolt, Mac Walker, Seth Donoughe, Jasper Götting

专题命中 安全评测 :safety(abstract);分类 cs.CY

AI总结 针对大语言模型生物滥用问题,引入BioTIER基准,将生物内容分三个风险集,含542个专家策划提示及元数据,可隔离控制灾难性风险信息,确保生物科学知识获取,助力针对性生物风险缓解。

Comments 52 pages, 9 main figures, 9 supplementary figures, 1 main table, 9 supplementary tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14400 2026-07-17 cs.CL cs.IR 新提交 57%

DS@GT ARC at LongEval: Citation Integrity and Factual Grounding in Scientific QA

DS@GT ARC参加LongEval:科学问答中的引用完整性和事实基础

Brandon Michaels, Brendon Johnson

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

AI总结 研究在科学问答中传统评估指标与引用完整性的差异,通过Corrective RAG和CiteFix构建纠正管道,对比前沿模型,发现前沿模型答案生成不依赖文档上下文,而纠正管道提升了引用忠实度和答案基础,提出需奖励严格答案基础的评估指标。

Comments 12 pages, 4 figures. Accepted to the CLEF 2026 LongEval Lab Working Notes

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14264 2026-07-17 cs.CV cs.CL 新提交 57%

MonteRET: AI Agent Enhancing Multimodal LLMs with Multi-granularity Knowledge Retrieval for Chest CT Report Generation

MonteRET:通过多粒度知识检索增强多模态大语言模型以生成胸部CT报告的人工智能代理

Yi Lin, Yihao Ding, Elana Benishay, Elefterios Trikantzopoulos, David Nauheim, Hanley Ong, Jiang Bian, Hua Xu, Yuzhe Yang, George Shih, Yifan Peng

机构 * Weill Cornell Medicine(威尔康乃尔医学院) University of Western Australia(西澳大利亚大学) Indiana University(印第安纳大学) Regenstrief Institute(瑞根斯特里夫研究所) Yale University(耶鲁大学) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 研究针对自动生成胸部CT报告的挑战,提出MonteRET框架,它整合多种特征,通过知识检索和报告重写代理完善报告。经训练和评估,该框架在多方面提升了报告质量,相比其他方法有显著优势,获放射科住院医师青睐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13940 2026-07-16 cs.AI 新提交 57%

A Self-Evolving Agent for Longitudinal Personal Health Management

一种用于纵向个人健康管理的自我进化智能体

Haoran Li, Jiebi Deng, Tong Jin, Jinghong Han, Yuxin Wang, Zexin Wang, Qingyi Si, Weikang Gong, Xiahai Zhuang, Jia You, Wei Cheng, Jianfeng Feng, Hongcheng Guo

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) School of Life Sciences, Beijing University of Chinese Medicine(北京中医药大学生命科学学院) Institute of Science and Technology for Brain-Inspired Intelligence, Fudan University(复旦大学脑科学与智能技术研究院) School of Computer Science and Technology, Huazhong University of Science and Technology(华中科技大学计算机科学与技术学院) JD.com, Inc.(京东公司) Key Laboratory of Computational Neuroscience and Brain-Inspired Intelligence, Fudan University, Ministry of Education(复旦大学计算神经科学与类脑智能教育部重点实验室) Department of Neurology, Huashan Hospital, Fudan University(复旦大学附属华山医院神经内科)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 研究针对多数健康AI系统孤立处理请求的问题,开发开源智能体架构HealthClaw,通过自我进化更新支持,经合成基准和生物医学任务评估,在准确率、隐私性及任务指标增益上表现出色,支持纵向个人健康智能体的自我进化记忆。

Comments 20 pages, 4 figures, 6 supplementary tables. Code: https://github.com/HC-Guo/HealthClaw

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13056 2026-07-16 cs.RO cs.LG 新提交 57%

HRIBench: Benchmarking Interaction-Centric Human-Robot Collaboration

HRIBench:以交互为中心的人机协作基准测试

Chang Liu, Jiawei Zhang, Tao Zhang, Ye Wang, Hongyu Zhou, Qin Jin

机构 * Renmin University of China(中国人民大学) Beijing Normal University(北京师范大学)

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 研究针对当前VLA基准未充分考量人机交互结构的问题,引入HRIBench基准,它以结构化场景脚本定义协作任务与交互角色,含多项可解释指标。通过实验表明该基准能暴露机器人策略局限,提升协作性能,推动以交互为中心的机器人学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12835 2026-07-15 cs.CL 新提交 57%

Can LLMs Write Reliable Rubrics? A Meta-Evaluation for Experiment Reproduction

大语言模型能写出可靠的评分标准吗?实验复现的元评估

Hanhua Hong, Yizhi Li, Jiaoyan Chen, Luu Gia Huy, Sophia Ananiadou, Jung-jae Kim, Chenghua Lin

机构 * The University of Manchester(曼彻斯特大学) Institute for Infocomm Research (I²R), A*STAR(资讯通信研究院(I²R),新加坡科技研究局) IQuest Research(IQuest研究公司) ELLIS Manchester(ELLIS曼彻斯特) University of Information Technology, VNU(越南国家大学信息技术大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 研究大语言模型生成的论文复现评分标准,将其 reformulate 为清单样式,在两个骨干模型上评估四种生成设置,通过语义相似性和分数对齐进行元评估,结果显示增强设置改善下游评估对齐,同时指出其存在过于细化、偏向高分和适应性差等问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12454 2026-07-15 cs.LG 新提交 57%

Exploring Zero-Shot Foundation Models for Multivariate Time Series Anomaly Detection

探索用于多变量时间序列异常检测的零样本基础模型

Martin Uray, Saverio Messineo, Roland Kwitt, Stefan Huber

机构 * Salzburg University of Applied Sciences(萨尔茨堡应用科学大学) Paris Lodron University of Salzburg(萨尔茨堡巴黎洛德龙大学)

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 研究多变量时间序列异常检测,探索单变量预测基础模型TimesFM的零样本应用于工业MTSAD,评估两种策略,虽未胜过基线,但发现其在捕获时间动态上过于有效致异常难区分,不过在异常边界误差有峰值,对变化点检测有前景。

Comments This preprint has not undergone peer review or any post-submission improvements or corrections. The Version of Record of this contribution will be published in Computer Aided Systems Theory - EUROCAST 2026, Lecture Notes in Computer Science, Springer

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12364 2026-07-15 cs.CV cs.AI 新提交 57%

Lost in Visual Translation: A VLM-Assisted Perceptual-Semantic Coherence Framework for EEG-to-Image Reconstruction

迷失在视觉翻译中:用于脑电到图像重建的基于视觉语言模型的感知语义连贯框架

Sukriti Tiwari, BHVSP Subrahmanyam, Nidhi Goyal, Sai Amrit Patnaik

机构 * Mahindra University(马欣德拉大学) MU-VT Interdisciplinary Advanced Research Centre for Transformative Technologies, Mahindra University(马欣德拉大学MU-VT变革性技术跨学科高级研究中心)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 研究脑电到图像重建中视觉保真度与语义可恢复性评估问题,引入基于四个视觉语言模型的框架,通过结构化问题评估图像对,产生宽容感知和语义对齐分数,提炼出脑机接口连贯分数,有效评估感知语义可恢复性。

Comments 27 pages, 3 figures, 13 tables. Accepted at the 5th International Workshop on Human Brain and Artificial Intelligence (HBAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12085 2026-07-15 cs.AI 新提交 57%

Operationalising Multi-Dimensional Evaluation for Conversational Agents: A Scalable, Governed Pipeline with Selective Re-evaluation and Model Benchmarking

实现对话代理的多维评估:一种具有选择性重新评估和模型基准测试的可扩展、受治理的管道

Niranjan Kumar M, Balaji Nagarajan, Karthik Nair, Faysal Satter, Nithin Surendran

机构 * Lowes(劳氏公司)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 研究针对零售对话代理评估难题,提出GenAI Evaluation管道,通过规范化等处理生产日志,能评估多维度指标。选择性重新评估提高效率,支持审计。每日处理约50000条记录,已评估超两百万次交互,取得较好分数和准确率。

Comments 14 pages, 1 figure of design of architecture and 2 tables exploring the results and benchmarking

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11783 2026-07-14 cs.CL 新提交 57%

How Temperature Shapes Ideological Discourse in Retrieval-Augmented Generation?

温度如何塑造检索增强生成中的意识形态话语?

Elmira Salari, Hazem Amamou, José Victor de Souza, Shruti Kshirsagar, Maria Nunes Delfino, Anderson Avila

机构 * Wichita State University(威斯康星州立大学) São Paulo Catholic University(圣保罗天主教大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 研究探讨温度对检索增强生成中意识形态话语的影响,通过对新冠治疗文章语料库应用词汇多维分析,让模型在不同温度下回答意识形态问题并评估,发现RAG框架易转移意识形态话语,中等温度下话语对齐最高,低温时下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11523 2026-07-14 cs.CV cs.AI 新提交 57%

Vinci2: Providing Proactive Assistance in Continuous Egocentric Videos

Vinci2:在连续自我中心视频中提供主动协助

Gong Sitong, Tianyu Yan, Caixin Kang, Bo Zheng, Xiang Ruan, Huchuan Lu, Kaipeng Zhang, Yoichi Sato, Yifei Huang

机构 * Dalian University of Technology(大连理工大学) Alaya Lab(阿莱雅实验室) The University of Tokyo(东京大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 研究连续自我中心视频中智能助手的主动协助问题,提出Vinci2系统,包含EgoServe基准测试和EgoMemo智能体,通过依赖上下文决策及相关技术,在新基准测试上建立强大基线且在现有测试中具竞争力。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10626 2026-07-14 cs.CL 新提交 57%

Eval-Pair Matrix: Answer-Paired Meta-Evaluation of LLM Judges for Grounded RAG

评估对矩阵:基于事实的检索增强生成中大型语言模型评判器的答案配对元评估

Sriram Selvam, Anneswa Ghosh

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 研究针对基于事实的检索增强生成中大型语言模型评判器自我宽容难识别问题,引入Eval-Pair Matrix协议,通过特定流程生成答案并评估,经实验得出同模型效应等结果,强调RAG评判器研究应报告多方面内容。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10511 2026-07-14 cs.CL 新提交 57%

Articulate Intuition or Genuine Analysis? Benchmarking Epistemic Reliability in LLM-as-a-Judge Peer Reviews

清晰的直觉还是真正的分析?评估大语言模型作为评审员的同行评审中的认知可靠性基准

Nuo Chen, Qian Wang, Qingyun Zou, Bingsheng He

机构 * National University of Singapore(新加坡国立大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

AI总结 研究大语言模型评审员与人类评审员对同行评审评估的差异,将卡尼曼双过程理论转化为评分标准并发布Kahneman4Review基准,通过多方面发现揭示问题,强调可靠基准应区分分析形式与认知功能并给出设计选择。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10411 2026-07-14 cs.SE cs.AI 新提交 57%

Mitigating LLM Sycophancy in Code Smell Detection Using Evidence-Guided Reasoning Prompts

使用证据引导推理提示减轻代码异味检测中的大语言模型谄媚现象

Istiaq Ahmed Fahad, Kamruzzaman Asif, Md. Nurul Ahad Tawhid

机构 * Institute of Information Technology(信息科技研究所) University of Dhaka(达卡大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 研究基于LLM的代码异味检测中谄媚偏差问题,通过MLCQ数据集评估不同提示框架影响,发现模型对提示变化敏感。提出证据引导去偏提示策略,降低决策不稳定性,提高鲁棒性,为解决该问题提供有效方法。

Comments 11 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10113 2026-07-14 cs.AI 新提交 57%

Dynamic Agent Skills: A Lifecycle Survey and Taxonomy of Evolving Skill Libraries

动态智能体技能:不断演进的技能库的生命周期调查与分类法

Yubo Li

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 研究大型语言模型智能体中技能库随时间的变化,通过分类法、生命周期架构和技能记录模式等工具组织文献,合成证据分级模式,指出相关问题并提出报告标准及开放问题。

Comments Accepted by TMLR (2026.07), OpenReview Link: https://openreview.net/forum?id=cjU3YbcRr8

Journal ref Transactions on Machine Learning Research, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09649 2026-07-13 cs.AI 新提交 57%

ConceptSMILE: Auditing the Trustworthiness of Concept-Based Explainable AI

ConceptSMILE:审计基于概念的可解释人工智能的可信度

Mohadeseh Mollapour, Koorosh Aslansefat, Zeinab Dehghani, Bhupesh Kumar Mishra, Tejal Shah, Zhibao Mian

机构 * University of Hull(赫尔大学) Newcastle University(纽卡斯尔大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 研究基于概念的可解释人工智能中概念级输出的可信度问题,提出ConceptSMILE审计框架,通过扰动输入区域等方法评估可靠性,在视网膜眼底图像上评估发现不同概念和路径可靠性有差异,为评估此类人工智能可信度提供独立审计层。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09528 2026-07-13 cs.LG cs.CR cs.DB cs.SI 新提交 57%

TSAI-MetaFraud: A Benchmark Dataset for Financial Fraud Transaction and Behavioral Risk Detection in Metaverse Ecosystems

TSAI-MetaFraud:用于元宇宙生态系统中金融欺诈交易和行为风险检测的基准数据集

Refat Ishrak Hemel, Ehsan Hallaji, Roozbeh Razavi-Far

机构 * tsai-unb(tsai - 新不伦瑞克大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

AI总结 针对元宇宙平台带来的欺诈等新挑战及现有数据集局限性,提出TSAI-MetaFraud基准数据集,整合多类信息与欺诈场景,定义多项基准任务并进行基线评估,为元宇宙生态系统相关研究提供基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09450 2026-07-13 cs.CV cs.LG 新提交 57%

Robustifying Vision-Language Models via Test-Time Prompt Adaptation

通过测试时提示自适应增强视觉语言模型的鲁棒性

Xingyu Zhu, Huanshen Wu, Shuo Wang, Beier Zhu, Jiannan Ge, Jiaheng Zhang, Long Chen

机构 * University of Science(科学大学) National University of Singapore(新加坡国立大学) The Hong Kong University of Science(香港科学大学)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 研究针对对抗扰动下视觉语言模型性能下降问题,提出RITA框架,通过最优传输实现分布级对齐,引入动态缓存积累线索,提升了模型对抗鲁棒性且不损干净准确率。

Comments ICML 2026 regular

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09443 2026-07-13 cs.CV cs.AI 新提交 57%

Parameter-Efficient Vision-Language Adaptation with Continuous Metadata Conditioning for Animal Re-Identification

基于连续元数据条件的参数高效视觉语言适配用于动物再识别

Anil Osman Tur, Tonje Knutsen Sordalen, Kim Tallaksen Halvorsen, Cigdem Beyan

机构 * Department of Computer Science, University of Verona(维罗纳大学计算机科学系) Institute of Marine Research(海洋研究所) University of Agder, Centre for Coastal Research(阿格德大学海岸研究中心)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 针对动物再识别中适应纵向生态环境的挑战,提出基于连续元数据条件的参数高效CLIP适配框架,通过保留元数据连续结构,在训练中平滑调制嵌入空间,提升了对外观变化和分布偏移的鲁棒性,实现纯视觉推理管道。

Comments This is the author's version of the paper accepted for publication in Expert Systems with Applications. The final authenticated version will be available from the publisher

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09099 2026-07-13 cs.AI 新提交 57%

L-MAD: A Systematic Evaluation of Multi-Agent Debate Structures in Legal Reasoning

L-MAD:法律推理中多智能体辩论结构的系统评估

Tan-Minh Nguyen, Hoang-Trung Nguyen, Huu-Dong Nguyen, Dinh-Truong Do, Thi-Hai-Yen Vuong, Le-Minh Nguyen

机构 * Japan Advanced Institute of Science(日本先进科学研究院) VNU University of Engineering(越南工程大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 研究在法律领域探索多智能体辩论(MAD)框架有效性,引入L-MAD框架评估不同结构和方法,通过分配专家角色提升效果,分析辩论规模发现权衡,明确了在法律推理中部署协作多智能体系统的边界与安全边际。

Comments Outstanding paper in the AI4Law Workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09065 2026-07-13 cs.SE cs.AI 新提交 57%

Inside the Skill Market: From Software Engineering Activities to Reusable Agent Skills

深入技能市场:从软件工程活动到可复用的智能体技能

Jialun Cao, Xinru Yan, Songqiang Chen, Yaojie Lu, Zhongxin Liu, Shing-Chi Cheung

机构 * The Hong Kong University of Science(香港科技大学) University of Chinese Academy of Sciences Beijing, China(中国科学院大学) Institute of Software, Chinese Academy of Sciences Beijing, China(中国科学院软件研究所) Zhejiang University Hangzhou, China(浙江大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 研究探讨软件工程活动如何转化为可复用智能体技能。通过对公共库和市场中SE技能大规模实证研究,分析其封装活动、生命周期覆盖等,发现SE活动正通过技能成为可复用工件,为技能推荐等提供研究机会及相关机制需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09053 2026-07-13 cs.CL 新提交 57%

An Emergent Mirage: Is Emergent Misalignment and Realignment Indeed a Robust Phenomenon?

一种新兴的海市蜃楼:新兴的错位与重新对齐真的是一种稳健的现象吗?

Abhinav Rao, Liancheng Gong, Bin Hu, Atharva Naik

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 研究新兴错位与重新对齐现象,通过受控微调循环研究其循环过程及相关表现,发现错位和重新对齐对数据集表面特征敏感,先前机制特征与行为错位不始终相关,指出当前EM证据欠稳健,需控制数据集伪像的评估协议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08839 2026-07-13 cs.CV cs.LG 新提交 57%

Mixture of Probes: Learning from Privileged Modalities in Multimodal LLMs Through Probing

混合探针:通过探针在多模态大语言模型中从特权模态学习

Dominick Reilly, Qiyu Wu, Hiromi Wakaki, Srijan Das, Yuki Mistufuji

机构 * Sony Group Corporation(索尼集团公司) Sony AI(索尼人工智能) University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 研究多模态大语言模型在特权模态设置下的问题,提出混合探针(MoP)框架及MoP跨模态训练(MoP-X),通过结构化探测机制分离模态信号,经评估在多任务中优于基线,有效利用辅助模态训练可提升性能。

Comments Preprint (16 pages)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08651 2026-07-10 cs.LG cs.DC 新提交 57%

Secure Decentralized Federated Learning via Gossip and Virtual Voting

通过八卦和虚拟投票实现安全的去中心化联邦学习

Amirhossein Taherpour, Xiaodong Wang

机构 * Columbia University(哥伦比亚大学)

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 研究如何实现安全的去中心化联邦学习,提出gspDAG-FL框架,通过八卦历史达成共识,结合多种验证方法提高弹性,经实验验证其在减少协调瓶颈、提高吞吐量及检测无效起源等方面效果良好,学习质量接近基于验证的账本FL。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08602 2026-07-10 cs.AI 新提交 57%

Towards Precision Therapy in Hepatocellular Carcinoma: A Clinical-Reasoning LLM for Risk Stratification and Treatment Guidance

迈向肝细胞癌的精准治疗:用于风险分层和治疗指导的临床推理大语言模型

Peng Cui, Jitao Wang, Siyan Xue, Yao Huang, Haoming Xia, Dong Li, Dengxiang Liu, Weilin Wang, Liping Liu, Leida Zhang, Yunfu Cui, Tao Peng, Daolin Ji, Haitao Zhao, Wei Zhang, Xiaojuan Wang, Weijie Ma, Zongren Ding, Jinlong Li, Yuan Ding, Jiajing Zhao, Zhiyu Chen, Chengkun Yang, Ziyue Huang, Jiaqi Liu, Fusheng Liu, Yang Zhou, Xiaojuan Wang, Zhongquan Sun, Shiyun Bao, Xiaojun Wang, Ming Yang, Guangxin Li, Bin Shu, Yong Liao, Hongxuan Li, Yao Tang, Shizhong Yang, Yongyi Zeng, Yufeng Yuan, Yinpeng Dong, Jihui Hao, Jun Zhu, Jiahong Dong

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 研究针对肝细胞癌治疗问题,提出HCC-STAR临床推理大语言模型。通过处理电子病历叙述输出风险分层、治疗方案等。经多中心队列验证,性能领先,能助医生决策,是可靠的肝细胞癌风险分层和精准治疗决策支持系统。

详情

展开后加载摘要…

URL PDF HTML 收藏