arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-10 至 2026-08-10 共收录 293 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 56 篇

2608.06880 2026-08-10 cs.LG 新提交 57%

SkillAligner: Treating Retrieved Skills as Adaptable Drafts at Execution Time

SkillAligner:在执行时将检索到的技能视为可调整的草稿

Qinfeng Li, Dalin He, Yuntai Bao, Ying Yang, Ruoxi Chen, Xinyan Yu, Lizhou Liang, Ge Su, Wenqi Zhang, Xuhong Zhang

机构 * Zhejiang University(浙江大学)

专题命中 效率与部署 :language agent(abstract);分类 cs.LG

AI总结 SkillAligner是无训练的执行时技能适配框架,将检索技能视为可调整草稿,经联合适配整合为执行指南,在多基准实验中提升任务性能、降低退化与推理成本。

Comments 21 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06612 2026-08-10 cs.CV cs.AI 新提交 57%

SLED: Scalable Location Encoding via Distillation

SLED:通过知识蒸馏实现可扩展位置编码

Kevin Lane, Zhongying Wang, Esther Rolf, Morteza Karimzadeh

专题命中 效率与部署 :pretraining(abstract);分类 cs.AI

AI总结 针对现有位置编码器计算成本高、扩展性差等问题,提出基于蒸馏的SLED,可灵活融入多模态地理空间数据,在19项基准任务上性能优于或媲美现有模型,大幅降低预训练成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27581 2026-08-10 cs.LG 版本更新 57%

MUGEN: A Unified Framework for Efficient Motion Understanding and Generation

MUGEN:用于高效运动理解与生成的统一框架

Zhankai Ye, Yukai Jin, Bingyang Wei, Bofan Li, Yusen Wu, Fangyi Li, Shangqian Gao, Xin Liu

机构 * Florida State University(佛罗里达州立大学) Texas Christian University(得克萨斯基督教大学) University of Miami(迈阿密大学) University of Pennsylvania(宾夕法尼亚大学)

专题命中 效率与部署 :language model(abstract);分类 cs.LG

AI总结 MUGEN是一个无码本的统一运动-语言框架,通过自适应长度自编码器实现高效运动压缩,在HumanML3D和SnapMoGen数据集上的生成、检索与对齐指标均表现优异,兼顾效率与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20255 2026-08-10 cs.CR cs.AI 版本更新 57%

The Ethics of Autonomous AI Agents for Offensive Security

用于进攻性安全的自主人工智能代理的伦理问题

Andreas Happe, Jürgen Cito, Jasmin Wachter

机构 * TU Wien(维也纳技术大学) University of Klagenfurt(克雷格福大学)

专题命中 效率与部署 :LLM(abstract);分类 cs.AI

AI总结 研究使用自主人工智能代理进行进攻性安全时的伦理问题,分析道德归因在多方的扩散及技术对利益相关者的影响,通过研究其不确定性等特性及攻防成本不对称性,为现有框架不适用于此情况提供分层建议。

Comments accepted at FAIEMA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22589 2026-08-10 cs.LG 版本更新 57%

Training-free Task Classification for Multi-Task Model Merging

无需训练的多任务模型合并中的任务分类

Jungyong Son, Jinwook Jung, Sungyong Baik

机构 * Department of Artificial Intelligence(人工智能系) Department of Data Science(数据科学系)

专题命中 效率与部署 :foundation model(abstract);分类 cs.LG

AI总结 提出SiM方法,通过SVD低秩流形近似和投影残差实现无需训练和任务ID的任务路由,提升多任务模型合并性能。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07462 2026-08-10 eess.AS cs.SD 新提交 50%

SemBridge: Semantic Token Anchoring for Continuous-Latent Autoregressive Speech Generation

SemBridge:用于连续隐变量自回归语音生成的语义令牌锚定

Hanke Xie, Haopeng Lin, Jiale Qian, Dake Guo, Yuepeng Jiang, Zhichao Wang, Wenxiao Cao, Jingbin Hu, Guobin Ma, Wenhao Li, Huakang Chen, Chengyou Wang, Ming Tao, Zhonghua Fu, Lei Xie, Xinsheng Wang

专题命中 效率与部署 :language model(abstract)

AI总结 该研究提出SemBridge框架,通过离散语义令牌监督自回归LM状态,在零样本TTS和SVS任务中提升内容准确性,同时保持说话人相似度与感知质量,为连续语音生成提供有效方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07434 2026-08-10 cs.CV cs.IR 新提交 50%

Conformal Coverage Guarantees for Any Video Temporal Grounder

任意视频时间定位器的共形覆盖保证

Aseel Mohamed, Rasul Khanbayov, Erchin Serpedin, Hasan Kurban

专题命中 效率与部署 :language model(abstract)

AI总结 针对视频时间定位器的模糊性问题,提出与模型无关的COVER包装器,可保证输出区域以至少1-α的概率包含真实时刻,在多基准和定位器上验证了其覆盖度符合目标值。

Comments Submitted to AAAI 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06959 2026-08-10 cs.CV 新提交 50%

Summarize First, Download Later: Onboard VLMs for Bandwidth-Efficient Earth Observation

先总结,后下载:面向带宽高效的地球观测的机载视觉语言模型

Junghwan Park, Sangcheol Sim, Woojin Cho, Darongsae Kwon

专题命中 效率与部署 :language model(abstract)

AI总结 针对地球观测卫星下行链路带宽瓶颈,提出“先总结,后下载”范式,通过机载VLM生成摘要、地面VQA验证后按需下载全分辨率图像,可降带宽消耗并加速时间敏感任务的洞察时间。

Comments IGARSS2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06794 2026-08-10 cs.CV 新提交 50%

PAST: Prompt-Adaptive Sampling Termination for Efficient Diffusion Model

PAST:用于高效扩散模型的提示自适应采样终止

Renye Yan, Jikang Cheng, You Wu, Wei Peng, Zongwei Wang, Ling Liang, Yimao Cai

机构 * Peking University(北京大学) Nanjing University(南京大学) Stanford University(斯坦福大学)

专题命中 效率与部署 :preference optimization(abstract)

AI总结 PAST是一种提示自适应采样终止方法,通过双自适应协调机制提升扩散模型RL微调的计算效率与偏好优化质量,效率最高提升66.7%,质量最高提升29.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06467 2026-08-10 cs.CV 新提交 50%

Test-Time Adaptation with Online Personalized Energy-Based Cache for Fine-Grained Video Expression Recognition

用于细粒度视频表情识别的基于能量缓存的在线个性化测试时自适应

Masoumeh Sharafi, Muhammad Osama Zeeshan, Soufiane Belharbi, Alessandro Lameiras Koerich, Marco Pedersoli, Eric Granger

专题命中 效率与部署 :language model(abstract)

AI总结 针对视频FER的测试时自适应难题,提出EB-CaP方法,通过轻量级能量模型结合CLIP生成个性化缓存,在低开销下优于现有SOTA方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 领域大模型 27 篇

2608.06429 2026-08-10 cs.CL cs.LG 新提交 92%

Recovering Lesion Parameters from Aphasic Picture Naming Error Profiles in Large Language Models

从大型语言模型中失语症图片命名错误轮廓中恢复损伤参数

Yong Yang, Roger Newman-Norlund, Xiang Guan, Saeed Ahmadi, Regan Willis, Nadra Salman, Kalil Warren, Sophie Arheix-Parras, Srihari Nelakuditi, Leonardo Bonilha, Christopher Rorden, Rutvik H. Desai, Julius Fridriksson

专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 该研究针对LLM的失语症图片命名错误轮廓,训练多任务神经网络恢复损伤参数,发现除层索引仅邻域可恢复外,修改百分比和噪声sigma可恢复,反事实验证达81.4%,还能泛化到中风幸存者数据,揭示Transformer层功能冗余。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18062 2026-08-10 cs.NI cs.AI 92%

LLM-hRIC: LLM-empowered Hierarchical RAN Intelligent Control for O-RAN

LLM-hRIC: 基于大语言模型的分层RAN智能控制用于O-RAN

Lingyan Bao, Sinwoong Yun, Jemin Lee, Tony Q. S. Quek

机构 * School of Electrical and Electronic Engineering, Yonsei University(延世大学电气与电子工程学院) Information System Technology and Design, Singapore University of Technology and Design(新加坡科技与设计大学信息系统技术与设计)

专题命中 领域大模型 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出LLM-hRIC框架,通过LLM与强化学习结合,提升O-RAN中RICs的协作效率与实时决策能力。

Comments To appear in IEEE Communications Magazine

Journal ref IEEE Communications Magazine, pp. 1-7, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07202 2026-08-10 cs.AI 新提交 90%

Authoring and Management of Transparent Research Integrity Assessments of Randomised Clinical Trial Publications Using LLM-assisted Tools and Provenance Knowledge Graphs

使用LLM辅助工具和来源知识图谱撰写与管理随机临床试验出版物的透明研究完整性评估

Milan Markovic, Goutham Indukuri, Somayajulu Sripada, Colby J. Vorland, Jack Wilkinson, Clare Robertson, Mark Bolland, Andrew Grey, Miriam Brazzelli, Alison Avenell

机构 * Interdisciplinary Institute, University of Aberdeen(阿伯丁大学跨学科研究所) University of Aberdeen(阿伯丁大学) Indiana University(印第安纳大学) University of Manchester(曼彻斯特大学) Aberdeen Centre for Evaluation, University of Aberdeen(阿伯丁大学阿伯丁评估中心) University of Auckland(奥克兰大学)

专题命中 领域大模型 :LLM(title,title_cn);分类 cs.AI

AI总结 本文介绍了基于LLM的INSPECT-AI工具,结合INSPECT-SR框架与RIPE-O本体,生成含140项评估的RIPE-KG,用于辅助人工评估已发表RCT的研究完整性。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06632 2026-08-10 cs.AI 新提交 90%

Shape Your Feed: An LLM-based Agentic System for Conversational Recommendation

塑造你的信息流:一种基于大语言模型的智能体对话推荐系统

Ziyun Xu, Bosen Ding, Yue Zhang, Ji Qi, Qingyuan Song, Jizhou Huang, Liwei Wang, Jefferey Santelli, Yue Weng, Qichao Que, Zhenheng Yang, Junfeng Pan, Linhong Zhu

机构 * Meta Platforms(元平台公司)

专题命中 领域大模型 :LLM(title,summary_cn);preference optimization(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出基于LLM的智能体推荐框架SYF,采用三层架构实现实时多模态内容协同策划,经离线评估与在线A/B实验验证,可提升信息流相关性与用户情感,为工业场景提供交互式推荐方案。

Comments Accepted in RecSys 2026 Industrial Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06422 2026-08-10 cs.LG 新提交 90%

Sharding Prevents LLM Oversight Failures and Adversarial Exploitation

分片可防止大语言模型(LLM)的监督失效与对抗性利用

Victor Akinwande, J. Zico Kolter, Aran Nayebi

专题命中 领域大模型 :LLM(title,title_cn);分类 cs.LG

AI总结 该研究针对LLM监督中裁决数量增加导致一致性下降的问题,提出分片方法,可提升监督一致性、抵御对抗攻击,且分片后较弱裁判可超越更强的整体裁判。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29738 2026-08-10 cs.CL cs.AI 版本更新 88%

Multi-Legal-Bench: Evaluating LLMs on Legal Reasoning Across Jurisdictions, Languages, and Legal Traditions

Multi-Legal-Bench: 跨司法管辖区、语言和法律传统的法律推理评估LLM

Volodymyr Ovcharov

机构 * SecondLayer

专题命中 领域大模型 :LLM(title_cn,summary_cn);pretraining(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 提出Multi-Legal-Bench,首个跨司法管辖区法律基准,在6个国家、4个语系和1.34亿份法院判决上评估LLM,发现少样本效果跨辖区复制、无单一模型主导所有语言、跨语言迁移不遵循语言邻近性、分词器效率不显著预测跨语言准确率。

Comments 17 pages, 5 figures, 9 tables. v2 corrects scorer and taxonomy defects, adds no-model baselines showing label leakage, re-runs the Lithuanian cells on de-leaked text, and withdraws the claim that few-shot helps on judgment-form classification everywhere; all tables and figures regenerated. Dataset: https://huggingface.co/datasets/overthelex/multi-legal-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17211 2026-08-10 q-fin.PM 版本更新 88%

Evolutionary Factor Searching for Sparse Portfolio Optimization Using Large Language Models

基于大语言模型的稀疏投资组合优化的进化因子搜索

Jiandong Chen, Haochen Luo, Yuan Zhang, Chen Liu, Qingfu Zhang

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract)

AI总结 本研究提出Evolutionary Factor Search框架,结合大语言模型与进化算法生成alpha因子,引入冗余感知权重分配模块处理因子冗余,经多市场实验验证其在稀疏投资组合优化中优于基线方法,为该领域提供了鲁棒可解释的新范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19592 2026-08-10 cs.AI cs.RO 85%

Adaptive Domain Modeling with Language Models: A Multi-Agent Approach to Task Planning

Harisankar Babu, Philipp Schillinger, Tamim Asfour

机构 * Bosch Center for Artificial Intelligence(博世人工智能中心) Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院)

专题命中 领域大模型 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.AI

Comments Accepted at IEEE CASE 2025, 8 pages, 8 figures

Journal ref 2025 IEEE 21st International Conference on Automation Science and Engineering (CASE), 2025, pp. 1701-1708

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06651 2026-08-10 cs.CR cs.SE 新提交 85%

CyberLLM: A Multi-Agent LLM Framework for Autonomous Detection and Guarded Response in Automotive Cybersecurity

CyberLLM:面向汽车网络安全的多智能体大语言模型框架,用于自主检测与受管控响应

Nenad Petrovic, Oussama Jeddou, Feres Ben Fraj, Vahid Zolfaghari, Fengjunjie Pan, Andre Schamschurko, Alois Knoll

专题命中 领域大模型 :LLM(title,summary_cn)

AI总结 CyberLLM是由大语言模型编排的多智能体框架,结合确定性检测层与大语言模型精化,在安全防护下实现汽车漏洞自主检测与修复,在基准测试中覆盖约70%漏洞且零误报,验证了LLM智能体自主防御的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06613 2026-08-10 cs.CV cs.AI 新提交 83%

Do 3D Medical Foundation Models See Through MRI Artifacts? A Controlled Study of Representation Robustness

三维医学基础模型能看穿MRI伪影吗?一项关于表示鲁棒性的对照研究

Julia Anna Mielcarz, Daniel Klaaby, Mostafa Mehdipour Ghazi

机构 * Pioneer Centre for AI, University of Copenhagen(哥本哈根大学先锋人工智能中心)

专题命中 领域大模型 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI

AI总结 本文对照评估五种三维医学基础模型的表示鲁棒性,发现其鲁棒性与模型及伪影类型相关,部分模型对伪影更敏感,仅靠大规模预训练无法保证伪影不变性,需部署前评估鲁棒性。

Comments Accepted at the ECCV 2026 Workshop on Artificial Intelligence for Medical 3D Vision (AI4M3D)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07250 2026-08-10 q-bio.QM cs.AI cs.CL 新提交 82%

Artificial Intelligence Can Match Domain Experts in Evidence Extraction and Critical Appraisal of Microbial Oncogenesis Research Publications

人工智能可在微生物致癌研究出版物的证据提取与严格评估上与领域专家相匹配

Kaela Kokkas, Hairong Wang, Richard Klein, Nazir A. Ismail, Natalie Irwin, Mohammad Z. Moonsamy, Kubendran Naidoo, Jeremy Nel, Ekene E. Nweke, Raveen Parboosing, Emmanuel K. Sekyi, Rebecca T. van Dorsten, Bruce A. Bassett, Robert F. Breiman

专题命中 领域大模型 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 本研究以MMTV-LV与乳腺癌为案例,构建数据集测试4款LLM在24篇微生物致癌研究论文的证据提取与评估任务上的表现,发现GPT-5等两款LLM性能与专家相当,可用于自动化系统证据综合,但仍存在方法学评估等弱点。

Comments Published in Frontiers in Cellular and Infection Microbiology, 45 pages, 14 figures

Journal ref Kokkas K, Wang H, Klein R, et al. (2026) Artificial intelligence can match domain experts in evidence extraction and critical appraisal of microbial oncogenesis research publications. Front. Cell. Infect. Microbiol. 16:1876326

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07418 2026-08-10 cs.AI cs.CL 新提交 82%

ResidencyRL: Reinforcement Learning in Simulated Clinical Environments

ResidencyRL:在模拟临床环境中开展的强化学习

Valentin Liévin, Samuel Schmidgall, Tim Strother, Alex Bijamov, Akshay Goel, Anil Palepu, Chunjong Park, Vahid Balazadeh, Min Woo Sun, Marius Guerard, Justin Chen, Dave Steiner, Vikram Dhillon, Ibrahim Azar, Akhil Mehta, Nicholas Spetsieris, Shilpan Shah, Maen Abdelrahim, Amit Dahiya, Yun Liu, Katherine Chou, Yossi Matias, Avinatan Hassidim, Dale R. Webster, Quoc V. Le, Raia Hadsell, Joelle Barral, Carey Radebaugh, Aleksandra Faust, Shekoofeh Azizi, Mike Schaekermann, Po-Hsuan Cameron Chen, Tao Tu, David Racz, Lin Yang

机构 * Google DeepMind(谷歌DeepMind) Google Research(谷歌研究院) Houston Methodist Hospital(休斯顿卫理公会医院) Trinity Health Group(三一健康集团) Stanford Oncology Partners(斯坦福肿瘤学伙伴) St. Luke Hospital(圣卢克医院)

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出 ResidencyRL,通过多轮强化学习训练临床 AI 智能体,在模拟临床环境中提升诊断准确性、降低漏报率,且能力可迁移至多个医学基准测试,为临床 AI 发展提供了新路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06471 2026-08-10 cs.CR cs.AI cs.SE 新提交 81%

CyberForge: Verified Vulnerability Injection at Repository Level for Cybersecurity Agent Training

CyberForge:用于网络安全智能体训练的、基于代码仓库级别的经验证漏洞注入框架

Amine Lbath, Manan Suri, Aurelien Delaitre, Vadim Okun, Massih-Reza Amini, Ram D. Sriram, Dinesh Manocha

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出CyberForge框架,通过向真实C/C++项目注入漏洞生成经验证的代码仓库级安全训练数据,微调后可提升智能体在SEC-bench和PatchEval上的漏洞修复性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06409 2026-08-10 cs.CL cs.AI 新提交 81%

Separating Decision-Rule Misalignment from Readout-Coverage Limitations in Speech Language Models

区分语音语言模型中的决策规则失配与读出覆盖限制

Linkai Peng, Baorian Nuchged

机构 * Institute for the Brain and Cognitive Sciences, University of Connecticut(康涅狄格大学脑与认知科学研究所) Department of Linguistics, The University of Texas at Austin(德克萨斯大学奥斯汀分校语言学系)

专题命中 领域大模型 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 该研究提出生成对齐诊断阶梯,区分语音语言模型的决策规则失配与读出覆盖限制,发现状态解码比生成准确率高27.8点,无标签logit校正可提升生成准确率,明确性能损失来源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07373 2026-08-10 physics.ed-ph 新提交 80%

A bottom-up taxonomy of student discourse with a Socratic AI physics tutor

基于苏格拉底式AI物理导师的学生话语自下而上分类学

Syed Furqan Abbas Hashmi, N. Sanjay Rebello

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本研究针对苏格拉底式AI物理导师,构建学生话语自下而上分类学,明确其分布特征,为物理教育研究提供学生与该类AI导师互动的话语参考

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06842 2026-08-10 econ.GN q-fin.EC 新提交 78%

Tabular Foundation Models and the Unity of Economic Behaviour

表格型基础模型与经济行为的统一性

Victor H. Aguiar

专题命中 领域大模型 :foundation model(title,abstract)

AI总结 本研究通过统一选择实验,用冻结的表格型基础模型恢复决策者隐藏选择,再估计随机效用模型,构建出适用于所有经济行为领域的统一模型,提升了选择预测效果。

Comments 56 pages, 4 figures, and 19 tables, including the appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07040 2026-08-10 cs.AI 新提交 77%

Not All Problems Are Best Modeled as MILP: A DSL-Centric Framework for Flexible and Accurate Optimization Modeling

并非所有问题都最适合建模为MILP:以DSL为核心的灵活且精准的优化建模框架

Shaofeng Zhang, Hongyuan Su, Qingwen Peng, Zefang Zong, Shengcai Liu, Ke Tang, Yong Li

专题命中 领域大模型 :LLM(summary_cn,abstract_cn);分类 cs.AI

AI总结 针对现有优化建模框架过度依赖MILP的缺陷,提出以DSL为核心的OptiDSL框架,通过LLM实现自然语言到标准化DSL的映射,在44种COP类型基准测试中显著优于MILP框架,建模准确率和效率大幅提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27540 2026-08-10 cs.AI 版本更新 77%

In-Context Examples Suppress Scientific Knowledge Recall in LLMs

上下文示例抑制大语言模型中的科学知识回忆

Chaemin Jang, Woojin Park, Hyeok Yun, Dongman Lee, Jihee Kim

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院) Shanghai Jiao Tong University(上海交通大学)

专题命中 领域大模型 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究发现上下文示例会削弱大语言模型对科学知识的回忆能力,使模型更依赖经验模式匹配而非预训练知识。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06931 2026-08-10 cs.AI 新提交 70%

Science Edge Evaluation: SEE the Missing Step Toward Real Scientific Discovery

科学边缘评估:SEE——迈向真实科学发现的缺失环节

Taolin Han, Yuchen Zhang, Jinghang Wang, Yun Wu, Wai Yuet Chiu, Zhaohai Li, Yifei Zhang, Jinxin Wang, Yuhao Zhou, Chen Zhao, Jiajia Li, Jiaxin Li, Qile Jin, Kewei Sun, Shuang Wu, Weiqi Zhai, Renquan Lv, Junchao Li, Ruodan Chen, Qingteng Chen, Zhibo Yang, Hu Wei, Lin Qu, Shuai Bai, Bing Zhao

机构 * Alibaba Group(阿里巴巴集团) University of Chinese Academy of Sciences(中国科学院大学) Tsinghua University(清华大学) University of Alberta(阿尔伯塔大学) Zhejiang University(浙江大学)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究构建多模态基准SEE评估19个MLLMs,发现其仅达48.7%准确率,通用模型优于专用模型,工具使用可提至52.7%但仍难实现科学发现所需的证据约束推断,需从解释转向推导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05563 2026-08-10 cs.CR cs.AI 版本更新 70%

When Experience Becomes Instruction: Trajectory Poisoning in Self-Evolving Agent Skill Systems

当经验成为指令:自进化智能体技能系统中的轨迹中毒攻击

Jialuo Chen, Lingqi Jiang, Xinhao Deng, Xiaohu Du, Jianan Ma, Yunhao Feng, Yuqi Qing, Zhihao Yuan, Linkang Du, Jingyi Wang

专题命中 领域大模型 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出PoisonedEvolution轨迹中毒攻击,针对自进化智能体技能系统的经验转指令过程,在SkillClaw等平台实现高成功率,证明了证据转化是这类系统的安全边界。

详情

展开后加载摘要…

URL PDF HTML 收藏