arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9331 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9331 篇

2608.05139 2026-08-06 cs.CL cs.LG 新提交 62%

Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning

面向技能原生的大语言模型:用于基准测试和训练长程推理的技能熵

Yinghui He, Ling Yang, Jiarui Liu, Yongjin Yang, Lechen Zhang, Yingcheng Wu, Zhenfei Yin, Mengdi Wang, Sanjeev Arora

机构 * Princeton University(普林斯顿大学) Carnegie Mellon University(卡内基梅隆大学) University of Toronto(多伦多大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Stanford University(斯坦福大学) University of Oxford(牛津大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 该研究针对现有基准无法评估LLM跨技能长程推理能力的问题,提出Skill Entropy(技能熵)并构建Skill²-Bench基准,还开发Skill-Entropy RL训练框架,显著提升了Qwen3模型在该基准上的表现。

Comments https://github.com/Gen-Verse/Skill-Entropy-RL

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04524 2026-08-06 cs.CL cs.LG 新提交 62%

ODRA: Synthesizing Cognitive Behavioral Therapy Sessions with Structured Chain-Of-Thought and Dynamic Patient Resistance

ODRA:结合结构化思维链与动态患者阻抗的认知行为治疗会话合成

Javier Rodriguez-Juan, Hiba Arnaout, Jose Garcia-Rodriguez, David Tomás, Iryna Gurevych

机构 * University of Alicante(阿利坎特大学) Technische Universität Darmstadt(达姆施塔特工业大学) Hessian Center for AI (hessian.AI)(黑森人工智能中心)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 本研究提出ODRA框架,结合结构化思维链与动态患者阻抗建模合成CBT会话,解决现有方法的顺从性问题,其生成的会话及微调数据集可提升下游治疗性能。

Comments 39 pages, 23 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04285 2026-08-06 cs.AI cs.LG 新提交 62%

The RAIL Principles for Neurosymbolic AI: Reasoning, Assurances, Interfacing and Learning

神经符号AI的RAIL原则:推理(Reasoning)、保证(Assurances)、接口(Interfacing)与学习(Learning)

Agnese Chiatti, Michael Cochez, Cristina Cornelio, Sebastijan Dumancic, Artur d'Avila Garcez, Luis C. Lamb, Lia Morra, Mathias Niepert, Robert Peharz, Alberto Speranzon, Maarten Stol, Annette Ten Teije, Thiviyan Thanapalasingam, Frank Van Harmelen, Emile Van Krieken, Antonio Vergari, Benjie Wang

机构 * Politecnico di Milano(米兰理工大学) ELLIS Institute Finland(芬兰ELLIS研究所) Åbo Akademi University(奥博 Akademi 大学) Samsung AI(三星人工智能研究院) Delft University of Technology(代尔夫特理工大学) Stony Brook University(石溪大学) Politecnico di Torino(都灵理工大学) University of Stuttgart(斯图加特大学) Graz University of Technology(格拉茨工业大学) Lockheed Martin, Advanced Technology Labs(洛克希德·马丁公司先进技术实验室) BrainCreators(BrainCreators公司) Vrije Universiteit Amsterdam(阿姆斯特丹自由大学) University of Amsterdam(阿姆斯特丹大学) University of Edinburgh(爱丁堡大学) UCLA(加利福尼亚大学洛杉矶分校)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 该文提出神经符号AI的RAIL四项原则,可统一分析多类AI系统,助力工程师更科学地设计部署生产级AI,指导整合神经符号方法到下一代AI技术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04525 2026-08-06 cs.CL cs.LG q-bio.GN 版本更新 62%

GENEB: Why Genomic Models Are Hard to Compare

GENEB:为什么基因组模型难以比较

Daria Ledneva, Mikhail Nuridinov, Denis Kuznetsov

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 针对基因组基础模型评估碎片化的问题,提出GENEB基准,通过统一探测协议在100项任务上比较40个模型,揭示模型排名不稳定、规模收益有限等关键发现。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03772 2026-08-05 cs.AI cs.LG cs.LO 新提交 62%

Computing Actual Causes for Neural Network Predictions under Structured Causal Inputs

结构化因果输入下神经网络预测的实际原因计算

Jannick Strobel, Muqsit Azeem, Stefan Leue

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对结构化因果输入下神经网络预测解释的误导性问题,提出基于布尔结构因果模型与边界传播、分支定界技术的方法,可高效计算所有最小实际原因,性能优于多种基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03700 2026-08-05 cs.CR cs.CL cs.CY 新提交 62%

When Agents Learn to Be You: Benchmarking Privacy Leakage, Impersonation Risk, and Defenses in Persona Skills

当智能体学会成为你:对角色技能中的隐私泄露、冒充风险及防御措施进行基准测试

Yongli Xiang, Zhifang Zhang, Bojun Yang, Ziming Hong, Lei Feng, Miao Xu, Tongliang Liu

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.CY

AI总结 该研究推出AntiSkillBench基准,评估角色技能流程的隐私泄露、冒充风险及防御,发现风险持续存在,现有防御效果有限,为相关技能开发提供基准。

Comments Project page: https://yonglixiang.github.io/AntiSkillBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03626 2026-08-05 cs.CR cs.AI cs.CY 新提交 62%

A Security-Oriented Lifecycle Model for Large Language Model Systems

面向大型语言模型系统的安全导向生命周期模型

Eleftherios Batzolis, George Drosatos, Vassilis Katsouros, Konstantinos Rantos

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 本文针对LLM系统生命周期框架重效率轻安全、治理与生命周期阶段脱节的问题,提出含32个阶段的安全导向生命周期模型,整合多监管框架发现治理证据分布不均的结构特性。

Comments Accepted as: Batzolis, E., Drosatos, G., Katsouros, V., & Rantos, K. (2026). A Security-Oriented Lifecycle Model for Large Language Model Systems. In: Kieseberg, P., Skopik, F., Atli, B., Schrittwieser, S., & Asplund, M. (Eds.), Availability, reliability and security---ARES 2026 EU Projects Symposium workshops (Lecture Notes in Computer Science, pp. 1-18). Springer Nature Switzerland

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03581 2026-08-05 cs.CY cs.AI 新提交 62%

AI-Assisted Peer Review Across Research Communities: From Reviewer AI Policies to LLM Review Quality

跨研究社区的AI辅助同行评审:从评审人AI政策到大语言模型评审质量

Alexander M. Fichtl, Lukas Ellinger, Josefin Kelber, Kryštof Olík, Georg Groh

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 该研究调研111个顶尖AI/NLP会议及医学期刊的AI评审政策,评估ICLR 2026和《自然·通讯》的AI评审质量,发现AI评审存在系统性缺陷,主张采用多维度评估。

Comments 30 pages, 19 figures, 10 tables. Currently under peer review. GitHub link for code and data is given in the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03148 2026-08-05 cs.LG cs.AI 新提交 62%

Lightweight Chunk Selection for Mobile Retrieval-Augmented Generation

面向移动端检索增强生成的轻量级分块选择

Sicong Chang, Yidan Shen, Wen Yu, Jiefu Chen, Xin Fu, Renjie Hu

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文针对移动端RAG部署的成本问题,提出结合LLM侧查询意图、MoE路由信号与检索分块嵌入的轻量级分块选择方法,提升了排名1的证据选择性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12787 2026-08-05 cs.AI cs.CL cs.CV cs.MM 版本更新 62%

Do We Really Need Multimodal Emotion Language Models Larger Than 1B Parameters?

我们真的需要参数超过10亿的多模态情感语言模型吗?

Kaiwen Zheng, Junchen Fu, Wenhao Deng, Hu Han, Joemon M. Jose, Xuri Ge

机构 * University of Glasgow(格拉斯哥大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) School of Artificial Intelligence, Shandong University(山东大学人工智能学院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 质疑多模态情感识别需参数超10亿模型的假设,提出轻量级MER框架Light-MER,通过知识蒸馏及两种优化策略,在九个基准数据集实验中实现最优性能并显著提高推理效率,凸显小模型潜力。

Comments Accepted by ACM MM2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13801 2026-08-05 cs.LG cs.AI 版本更新 62%

Improving Reproducibility in Evaluation through Multi-Level Annotator Modeling

通过多级标注者建模提高评估的可重复性

Deepak Pandita, Flip Korn, Chris Welty, Christopher M. Homan

机构 * Rochester Institute of Technology(罗切斯特理工学院) Google Research(谷歌研究)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出多级抽样方法,通过分析标注者数量与响应数量的平衡,提升评估结果的可重复性与统计显著性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08442 2026-08-05 cs.CR cs.AI cs.LG 版本更新 62%

Injection-Execution Dissociation: A Mechanistic Evaluation of Persistent Memory Attacks and Defenses in Stateful LLM Agents

多层架构中的防御效果:对持久内存攻击状态机LLM代理的机制性评估

Jun Wen Leong

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文评估了六种防御措施在九个开源模型上的延迟触发攻击效果,发现输入级和检索级过滤器效果不佳,而内存层工具门控(Memory Sandbox)显著降低攻击成功率,揭示了不同防御类别的失效原因。

Comments v4: Added double dissociation (reasoning-mode ablation), content-layer defense (RATG), loaded-corpus frontier evaluation (21 models, 3 providers, N=40), 7B judge capability bound, reproducibility validity criterion, ethics/disclosure statement. Gemini 3.1 Pro Preview 95% ASR; GPT-5.1 regression (22.5%); tripartite vendor divergence. Code: github.com/junwenleong/stateful-agent-security-eval

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16217 2026-08-05 cs.CL cs.AI 版本更新 62%

ChiEngMixBench: Evaluating Large Language Models on Expert-Style Chinese-English Terminology Mixing

ChiEngMixBench: 评估大型语言模型在自发和自然的中英混合生成中的能力

Qingyan Yang, Tongxi Wang, Yunsheng Luo

机构 * School of Future Technology(未来技术学院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 ChiEngMixBench通过评估中英混合生成的自发性和自然性,揭示多语言模型与人类交流的结构化认知对齐

Comments 15 pages, 2 figures, 8 tables. Substantially revised version

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01792 2026-08-04 cs.AI cs.CL 新提交 62%

Can You Trust the Confidence? ConfBench for Vision-Language Models on Document Extraction

你能信任置信度吗?面向文档提取的视觉语言模型ConfBench

Priyashree Roy, Sujitha Martin, Mohammad Rostami, Spencer Romo, Renhao Xue, Bob Strahan, Diego A. Socolinsky, Boyi Xie, Md Mofijul Islam

机构 * Amazon Web Services(亚马逊网络服务)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对视觉语言模型的文档提取任务推出校准专用基准ConfBench,评估多类VLM的置信度估计方法,揭示模态、模型能力等对置信度的影响,发布相关指标以助力可信IDP部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00717 2026-08-04 cs.AI cs.CL 新提交 62%

AI-Based Thesis Assessment: An Empirical Study of Human Evaluation Priorities and Their Impact on Automated Assessment

基于人工智能的论文评审:关于人类评审优先级及其对自动评审影响的实证研究

Garv Vikram Gursahaney, Baskhad Idrisov, Thorsten Fröhlich, Tim Schlippe

机构 * IU International University of Applied Sciences(IU应用科学大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 该研究调查了84名导师确定的35项论文评审准则权重,对比人工智能系统RubiSCoT的默认权重后发现存在显著差异,整合导师权重的最优配置仅小幅降低评审偏差且无统计显著性,仅权重校准无法大幅提升AI与人类评审的一致性。

Comments Accepted for publication in the Proceedings of the 7th International Conference on Artificial Intelligence in Education Technology (AIET 2026), Zagreb, Croatia

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00011 2026-08-04 cs.CL cs.AI 新提交 62%

DLLM-TTS: Block Discrete Diffusion Language Model for Text-to-Speech Synthesis

DLLM-TTS:用于文本到语音合成的块离散扩散语言模型

Wasim Madha, Nityanand Mathur, Hamees Sayed, Apoorv Singh, Sameer Khurana, Akshat Mandloi, Sudarshan Kamath

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出 DLLM-TTS 框架,将 TTS 建模为基于 X-Codec2 的条件块离散扩散,通过块内掩码扩散与并行预测实现高效语音生成,在 Seed-TTS-eval 基准上取得良好性能,兼具实用性与数据效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22660 2026-08-04 cs.CL cs.AI 版本更新 62%

Moral Semantics Survive Machine Translation: Cross-Lingual Evidence from Moral Foundations Corpora

道德语义在机器翻译中得以保留:来自道德基础语料库的跨语言证据

Maciej Skorski

机构 * University of Luxembourg(卢森堡大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本研究探讨了基于LLM的翻译是否能弥合道德价值观分类中语言特定标注语料库的差距,通过波兰语案例展示直接翻译能有效保留微妙的道德线索,为资源匮乏语言的道德研究提供了可行路径。

Comments Accepted to GoodIT'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00665 2026-08-04 cs.CL cs.AI 版本更新 62%

Can Small Language Models Handle Context-Summarized Multi-Turn Customer-Service QA? A Synthetic Data-Driven Comparative Evaluation

小语言模型能否处理上下文总结的多轮客户服务问答?一种合成数据驱动的比较评估

Lakshan Cooray, Deshan Sumanathilaka, Pattigadapa Venkatesh Raju

机构 * School of Computing, Informatics Institute of Technology(计算学院,信息学院技术研究所) School of Mathematics and Computer Science, Swansea University(数学与计算机科学学院,萨默塞特大学) R&D, Zame AI(Zame AI研发部)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文通过合成数据评估小语言模型在多轮客户服务问答中的表现,发现部分模型接近大语言模型性能,但整体仍存在对话连续性和上下文对齐的挑战。

Comments Published at Frontiers in Artificial Intelligence, Natural Language Processing Section

Journal ref Frontiers in Artificial Intelligence, 9:1804284, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29624 2026-08-03 cs.CY cs.AI cs.HC 新提交 62%

The Theoretical Foundation of Socratic Tests: Dynamic, Multimodal, Conversational Examinations

苏格拉底测试的理论基础:动态、多模态、对话式考试

Ilya Mikhelson

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 本文提出苏格拉底测试的理论基础,整合多类教育评估原则与分类学,量化最近发展区并设计非补偿性加法评分架构,以解决传统评估的缺陷并提升测量可靠性。

Comments 21 pages, 1 figure, submitted to Computers and Education: Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28665 2026-08-03 cs.LG cs.AI 新提交 62%

Sensitivity Analysis of GRU, LSTM and Transformer Encoder in Classification of Automated Driving Systems

GRU、LSTM与Transformer编码器在自动驾驶系统分类中的敏感性分析

Bidhya Shrestha, Christos Papadopoulos

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文研究GRU、LSTM、Transformer编码器对Level 2级自动驾驶系统的分类性能,提出含5类损坏的鲁棒性评估框架,发现时间抖动会大幅降低三类模型的宏F1。

Comments 7 pages, 6 figures, under review Milcom 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07699 2026-08-03 cs.CL cs.AI 版本更新 62%

DRIP-R: A Benchmark for Decision-Making and Reasoning Under Real-World Policy Ambiguity in the Retail Domain

DRIP-R:零售领域决策与推理在现实政策模糊性下的基准测试

Hsuvas Borkakoty, Sebastian Pohl, Cheng Wang, Bei Chen, Yufang Hou

机构 * Interdisciplinary Transformation University Austria(跨学科转型大学奥地利) Amazon Berlin(亚马逊柏林)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 DRIP-R基准测试通过现实零售政策模糊性构建无唯一正确解决方案的场景,评估LLM在模糊政策下的决策与推理能力,揭示其固有的系统性挑战。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28146 2026-07-31 cs.CL cs.AI 新提交 62%

Can Agents Deceive? Evaluating Reasoning and Deception in ParliamentBench using a Social Deduction Game

智能体能够欺骗吗?使用社交推理游戏评估ParliamentBench中的推理与欺骗能力

Niklas Bauer, Lars Benedikt Kaesberg, Akiko Aizawa, Jan Philip Wahle, Bela Gipp, Terry Ruas

机构 * University of Göttingen(哥廷根大学) National Institute of Informatics(信息学研究所) University of Tokyo(东京大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 该研究基于《Secret Hitler》游戏构建ParliamentBench基准,评估16个LLM的欺骗与推理能力,发现前沿模型表现优异,多数LLM难以维持一致的欺骗人设。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12790 2026-07-31 cs.AI cs.CL cs.MA 版本更新 62%

Who Grades the Grader? Co-Evolving Evaluation Metrics and Skills for Self-Improving LLM Agents

谁来评估评估者?用于自我改进的语言模型代理的协同进化评估指标和技能

Xing Zhang, Guanghui Wang, Yanwei Cui, Ziyuan Li, Wei Qiu, Bing Zhu, Peiyang He

机构 * Amazon(亚马逊)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 研究自我进化智能体系统中评估指标缺失问题,提出指标可进化,通过“双棘轮”协同进化指标与技能循环,在多任务中保留提升效果,还阐述安全性源于锚定规则与外部审核,为无可靠自动验证器场景提供架构。

Comments Code: https://github.com/amazon-science/Self-Evolving-Agents-Double-Ratchet

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12449 2026-07-31 cs.CV cs.AI cs.IR cs.LG 版本更新 62%

MOON2.0: Dynamic Modality-balanced Multimodal Representation Learning for E-commerce Product Understanding

MOON2.0:动态模态平衡多模态表示学习用于电商产品理解

Zhanheng Nie, Chenghan Fu, Daoze Zhang, Junxian Wu, Wanxian Guan, Pengjie Wang, Jian Xu, Bo Zheng

机构 * Alibaba Group(阿里巴巴集团)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 MOON2.0通过动态模态平衡框架解决电商多模态数据中的模态不平衡、信息对齐不足和噪声处理问题,提出MoE、双层对齐和图像-文本共增强策略,提升零样本性能和多模态对齐质量。

Comments Accepted by the IEEE Conference on Computer Vision and Pattern Recognition (CVPR), 2026. 11 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20780 2026-07-31 cs.AI cs.CL cs.CV 版本更新 62%

MedHallTune: An Instruction-Tuning Benchmark for Mitigating Medical Hallucination in Vision-Language Models

MedHallTune:用于缓解视觉-语言模型中医患幻觉的指令调优基准

Qiao Yan, Yuchen Yuan, Xiaowei Hu, Yihan Wang, Jiaqi Xu, Xiwen Wu, Jinpeng Li, Chi-Wing Fu, Pheng-Ann Heng

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出MedHallTune基准,用于评估和缓解医疗视觉-语言模型的幻觉,实验表明用该基准微调模型可提升幻觉管理能力与下游VQA任务零样本性能,助力开发更可信的医疗视觉-语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26066 2026-07-30 cs.CL cs.AI cs.DL 新提交 62%

Do Methods Support the Claims? Intra-Paper Verification for Peer Review

方法是否支持其主张?用于同行评审的论文内部验证

Ranjitha Shivaprasad Ballakuraya, Arash Mahyari, Ashok Srinivasan

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对现有 LLM 评审系统忽视论文内部主张与方法学证据不匹配的问题,提出 intra-paper claim verification 框架,经实验验证其生成的评审意见与人类评审关注点高度契合。

Comments 9 pages, 8 figures. Source code, prompts, evaluation materials, and supporting data available at https://github.com/Ranjitha2493/intra-paper-claim-method-verification

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23624 2026-07-30 cs.SE cs.AI cs.CL 版本更新 62%

Where Is the Cost of Third-Party API Routers in Agentic Software Development?

代理软件开发中第三方 API 路由器的成本在哪里?

Donghao Fu, Jingxin Li, Xue Jiang, Yihong Dong

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 研究第三方 API 路由器在代理软件开发中的影响,通过实证研究编码代理中路由器端注入的四个干预级别,开发 SIDEL 框架评估代理,发现路由器端干预难测,客户端缓解措施未完全恢复控制,强调需提供商端输出完整性保证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01527 2026-07-30 cs.SE cs.AI cs.LG 版本更新 62%

REAP: Automatic Curation of Coding Agent Benchmarks from Interactive Production Usage

REAP:从交互生产使用自动整理编码代理基准

Smriti Jha, Matteo Paltenghi, Chandra Maddila, Vijayaraghavan Murali, Shubham Ugare, Satish Chandra

机构 * Meta, USA(Meta公司)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 REAP通过自动化流程从真实开发者与代理交互中构建生产基准,解决评估信号不可靠问题,通过LLM分类和多轮稳定性检查确保基准可信。

Comments Accepted at ASE 2026 Industry Showcase

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25947 2026-07-29 cs.AI cs.CL 新提交 62%

A Cost-Effective Multimodal LLM Reasoning Framework for Question Answering over Irregular Clinical Time Series

一种用于不规则临床时间序列问答的经济高效多模态大语言模型推理框架

Frank Nie, Ethan B Liu, Yuan Zhu, Wei Fan, Jindong Han

机构 * Shandong University(山东大学) University of Auckland(奥克兰大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 针对不规则临床时间序列问答,提出ClinPRISM框架。该框架含不规则感知多尺度编码器、时间证据蒸馏器和渐进对齐策略,通过构建训练数据,在40亿参数大语言模型主干上实现最优性能,兼具低时间序列令牌数和低推理延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21571 2026-07-29 cs.CL cs.AI cs.CR 版本更新 62%

Towards Understanding the Cognitive Habits of Large Reasoning Models

迈向理解大型推理模型的认知习惯

Jianshuo Dong, Yujia Fu, Chuanrui Hu, Chao Zhang, Han Qiu

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 研究大型推理模型是否展现类人认知习惯,基于“思维习惯”框架引入CogTest基准测试,对16个语言模型评估发现LRMs有类人习惯且能自适应运用,还揭示了习惯异同模式及与有害回答的关联,为理解模型不当行为提供重要依据。

Comments Published at Machine Intelligence Research vol.23, no.4, pp.873-886

详情

展开后加载摘要…

URL PDF HTML 收藏