arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-13 至 2026-07-13 共收录 47 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 3 篇

2606.03979 2026-07-13 cs.LG cs.AI 版本更新 84%

Language Models Need Sleep: Learning to Self-Modify and Consolidate Memories

语言模型需要睡眠:学习自我修改和巩固记忆

Ali Behrouz, Farnoosh Hashemi, Adel Javanmard, Vahab Mirrokni

机构 * Google(谷歌) Cornell University(康奈尔大学)

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);分类 cs.AI、cs.LG

AI总结 受人类学习过程启发,提出“睡眠”范式,通过记忆巩固(知识播种)和梦境(自我改进)两阶段,使模型持续学习、将短期记忆转化为长期知识并自我提升。

Comments A version of this work has been publicly available from September 2025 on OpenReview

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29858 2026-07-13 cs.CL 版本更新 77%

Smooth Scaling Laws Hide Stepwise Token Learning

平滑缩放定律隐藏了逐步的令牌学习

Pingjie Wang, Zechen Hu, Peiru Yang, Fu Guo, Debing Zhang

机构 * Dots Studio, Xiaohongshu Inc.(dots studio,小红书公司) Shanghai Jiao Tong University(上海交通大学) Tsinghua university(清华大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.CL

AI总结 本文提出令牌级框架,将缩放定律分解为上下文令牌的局部学习事件,通过拟合S形曲线发现令牌学习集中在局部转换中,并利用学习时间谱定量重建验证损失导数,进而通过重塑训练分布实现11%的验证损失加速降低。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10145 2026-07-13 cs.CL 版本更新 77%

Lost in Backpropagation: The LM Head is a Gradient Bottleneck

陷入反向传播:语言模型头部是一个梯度瓶颈

Nathan Godey, Yoav Artzi

专题命中 预训练与数据 :LLM(abstract_cn);language model(abstract);pretraining(abstract);分类 cs.CL

AI总结 语言模型头部的梯度瓶颈导致表达和优化受限,影响训练效率,需新设计

Comments To be presented at COLM'26

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 指令微调 2 篇

2511.17813 2026-07-13 cs.CL cs.AI cs.LG cs.SD 版本更新 90%

Point of Order: Action-Aware LLM Persona Modeling for Data-Grounded Civic Deliberation

秩序点:面向行动的LLM角色建模用于真实市政模拟

Scott Merrill, Shashank Srivastava

专题命中 指令微调 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种可复现的流程,将公开Zoom录像转换为带有角色档案和行动标签的发言转录,通过细调LLM提升角色建模效果,显著降低困惑度并提高模拟真实性和一致性。

Comments 8 pages (39 pages including appendix), 29 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01206 2026-07-13 cs.CL cs.LG 版本更新 88%

RELISH: LLM REgression with a Latent Iterative State Head

基于潜在迭代状态头的大型语言模型回归

Yiheng Su, Matthew Lease

专题命中 指令微调 :LLM(title,abstract);language model(abstract,comments);large language model(abstract);分类 cs.CL、cs.LG

AI总结 RElish通过迭代优化潜在状态实现文本回归,优于三种主流回归方法,参数效率高。

Comments Accepted to the Third Conference on Language Modeling (COLM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 后训练与偏好优化 2 篇

2506.01692 2026-07-13 cs.AI cs.LG 版本更新 88%

A Descriptive and Normative Theory of Human Beliefs in RLHF

基于人类反馈强化学习中的人类信念描述性与规范性理论

Sylee Dandekar, Shripad Deshmukh, Frank Chiu, W. Bradley Knox, Scott Niekum

机构 * College of Information and Computer Sciences University of Massachusetts Amherst(信息与计算机科学学院 马萨诸塞大学阿姆赫斯特分校) Department of Computer Science The University of Texas at Austin(计算机科学系 德州大学奥斯汀分校)

专题命中 后训练与偏好优化 :RLHF(title,summary_cn);分类 cs.AI、cs.LG

AI总结 研究 RLHF 中人类信念作用,提出新偏好模型,通过人类和综合实验,证实人类对智能体能力信念影响偏好,指出减少信念与能力不匹配可提升 RLHF 并给出新实践方向。

Comments Published at TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20140 2026-07-13 cs.AI cs.LG 版本更新 86%

HiPO: Hierarchical Preference Optimization for Adaptive Reasoning in LLMs

HiPO:用于大语言模型自适应推理的分层偏好优化

Darsh Kachroo, Arjun Prasaath Anbazhagan, Adriana Caraeni, Brennan Lagasse, Kevin Zhu

机构 * Vellore Institute of Technology(维洛雷理工学院) University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校) Northwestern University(西北大学) Yale University(耶鲁大学) Algoverse AI Research(Algoverse AI研究)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 HiPO通过分层优化提升大语言模型在复杂推理任务中的表现,结合偏好优化与结构化推理的优势,实现更高效的训练和更一致的输出。

Comments 12 pages, 4 figures, 6 tables. Includes ablation study across Qwen2.5-7B-Instruct and Llama-3.1-8B-Instruct on 5 math reasoning benchmarks (GSM8K, MATH500, Minerva, AIME24, Gaokao2023). GPT-4.1 used for structured evaluation of reasoning quality

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 长上下文与记忆 7 篇

2511.20297 2026-07-13 cs.AI 版本更新 90%

Improving Language Agents through BREW: Bootstrapping expeRientially-learned Environmental knoWledge

通过BREW改进语言智能体:引导式经验学习环境知识

Shashank Kirtania, Param Biyani, Priyanshu Gupta, Yasharth Bajpai, Roshni Iyer, Sumit Gulwani, Gustavo Soares

机构 * University of Michigan(密歇根大学) Independent(独立研究者) Microsoft(微软) Apple(苹果公司)

专题命中 长上下文与记忆 :LLM(summary_cn,abstract);language agent(title);large language model(abstract);language model(abstract)

AI总结 研究基于LLM的智能体无法从经验学习的问题,提出BREW框架,通过提炼交互轨迹成知识库、引入EG-MCTS算法及适应事后重标记等方法,在多基准测试中提升任务成功率并减少执行步骤,且知识库具有良好特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14817 2026-07-13 cs.CL cs.AI 版本更新 79%

Evaluating Retrieval-Augmented Generation vs. Long-Context Input for Clinical Reasoning over EHRs

评估检索增强生成与长上下文输入用于电子健康记录临床推理的效果

Skatje Myers, Dmitriy Dligach, Timothy A. Miller, Samantha Barr, James Landefeld, Yanjun Gao, Matthew Churpek, Anoop Mayampurath, Majid Afshar

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Loyola University Chicago(芝加哥洛约拉大学) Boston Children’s Hospital Harvard Medical School(波士顿儿童医院哈佛医学院) University of Colorado-Anschutz(科罗拉多大学安舒茨分校)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 研究评估检索增强生成(RAG)用于电子健康记录临床推理的效果,定义三个基于EHR的任务,用真实住院临床记录评估三种大语言模型,发现RAG在成像程序和抗生素时间线任务中令牌效率高,诊断生成任务较具挑战性,RAG是临床任务的有效方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15806 2026-07-13 cs.CL cs.AI 版本更新 73%

REAL: REtrieval-reAsoning and Logic-constructed Attention Behaviors for Long-Context KV Cache Compression

REAL:用于长上下文KV缓存压缩的检索推理和逻辑构建注意力行为

Mengjie Li, Yuan Feng, Xike Xie, William J. Song

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对大语言模型KV缓存问题,受混淆矩阵启发提出REAL方法,通过注意力行为矩阵全面分析注意力头行为,最大化信噪比,经评估在多模型和基准测试中性能显著,为长上下文建模方法转变提供新思路。

Comments Accepted at ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12939 2026-07-13 cs.RO 版本更新 71%

RoboStream: Weaving Spatio-Temporal Reasoning with Memory in Vision-Language Models for Robotics

RoboStream: 用记忆融合时空推理提升视觉语言模型在机器人中的应用

Yuzhi Huang, Jie Wu, Weijue Bu, Ziyi Xiong, Gaoyang Jiang, Ye Li, Kangye Ji, Shuzhao Xie, Yue Huang, Chenglei Wu, Jingyan Jiang, Zhi Wang

机构 * Shenzhen International Graduate School, Tsinghua University(深圳国际研究生院,清华大学) YXGN Robotics(YXGN机器人) China University of Mining and Technology(中国矿业大学) Shenzhen Technology University(深圳技术大学) Huazhong University of Science and Technology(华中科技大学) Xiamen University(厦门大学)

专题命中 长上下文与记忆 :language model(title)

AI总结 RoboStream通过时空融合令牌和因果时空图实现持久记忆,解决机器人长时间任务中的几何锚定和状态追踪问题,提升长期任务表现。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.00111 2026-07-13 cs.CR cs.LG cs.SE 版本更新 57%

Ruby: Unmasking Unsafe Rust in Stripped Binaries via Machine Learning

Ruby:通过机器学习揭示剥离二进制文件中的不安全Rust

Xiang Cheng, Sangdon Park, HyungSeok Han, Xiaokuan Zhang, Taesoo Kim

机构 * Georgia Institute of Technology(佐治亚理工学院) Pohang University of Science and Technology(釜山科学技术大学) Microsoft(微软公司) George Mason University(乔治·梅奥大学)

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.LG

AI总结 研究旨在揭示Rust二进制文件中的不安全区域,核心方法是用机器学习工具Ruby捕获二进制指令差异,主要贡献为识别大部分不安全区域且误报率低,应用于指导符号执行和模糊测试有显著速度提升并帮助修复安卓库漏洞。

Comments Accepted to DSN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21309 2026-07-13 cs.CV 版本更新 50%

Test-Time Adaptation via Cache Personalization for Facial Expression Recognition in Videos

基于缓存个性化的时间测试适应用于视频面部表情识别

Masoumeh Sharafi, Muhammad Osama Zeeshan, Soufiane Belharbi, Alessandro Lameiras Koerich, Marco Pedersoli, Eric Granger

机构 * LIVIA, Dept. of Systems Engineering, ETS Montreal, Canada(LIVIA系统工程系,蒙特利尔工程学院,加拿大) LIVIA, Dept. of Software and IT Engineering, ETS Montreal, Canada(LIVIA软件与信息工程系,蒙特利尔工程学院,加拿大)

专题命中 长上下文与记忆 :language model(abstract)

AI总结 本文提出TTA-CaP方法,通过缓存实现高效视频面部表情识别的模型个性化,减少计算开销并提升跨主体和环境变化的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13744 2026-07-13 math.ST stat.TH 版本更新 50%

A Note on k-NN Gating in RAG

关于检索增强生成(RAG)中k近邻门控的一个注释

Gérard Biau, Claire Boyer

专题命中 长上下文与记忆 :language model(abstract)

AI总结 为检索增强生成(RAG)提出统计代理框架,推导出最优查询级门控,通过检索不一致性分析幻觉并建模查询-内存不匹配,还进行了数值验证。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 推理与问题求解 9 篇

2508.20134 2026-07-13 cs.AI cs.ET quant-ph 版本更新 87%

QAgent: An LLM-based Multi-Agent System for Autonomous OpenQASM programming

QAgent:一种基于大语言模型的用于自主OpenQASM编程的多智能体系统

Zhenxiao Fu, Lei Jiang, Yilun Xu, Gang Huang, Fan Chen

机构 * Zhenxiao Fu1, Lei Jiang1, Yilun Xu2, Gang Huang2, Fan Chen1(作者1、作者2、作者3、作者4、作者5)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对OpenQASM编程挑战提出QAgent,它是基于大语言模型的多智能体系统,集成规划、合成和校准工作流程,利用检索增强生成及多智能体推理确保正确性,在多模型评估中表现出色,证明集成对可靠量子程序生成很关键。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00130 2026-07-13 cs.CL 版本更新 85%

Hierarchical Chain-of-Thought: Enhancing LLM Reasoning Performance and Efficiency

层次化思维链提示:提升大语言模型推理性能与效率

Xingshuai Huang, Derek Li, Bahareh Nikpour, Parsa Omidi

机构 * Huawei Technologies Canada, Canada(华为技术加拿大公司,加拿大)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出层次化思维链提示方法,通过分层步骤规划与执行提升复杂多步推理的准确率和效率,实验显示在多种模型和任务中平均准确率提升6.2%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.12322 2026-07-13 cs.CV 版本更新 78%

Zero-shot 3D General Obstacle Detection via Multimodal Foundation Models and Geometry

通过多模态基础模型和几何进行零样本3D通用障碍物检测

Tamás Matuszka, Péter Hajas, Dávid Szeghy

机构 * aiMotive

专题命中 推理与问题求解 :foundation model(title,abstract)

AI总结 针对自动驾驶中通用障碍物检测难题,提出结合多模态基础模型与几何推理的免训练零样本方法,能精准定位达100米,借基础模型先验提升召回率,还可实现可扩展自动标注。

Comments Accepted to CVPR 2026 AUTOPILOT Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10229 2026-07-13 cs.CL 版本更新 77%

Latent Thoughts Tuning: Bridging Context and Reasoning with Fused Information in Latent Tokens

潜在思维调整:通过潜在令牌中的融合信息连接上下文与推理

Weihao Liu, Dehai Min, Lu Cheng

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL

AI总结 研究提出潜在思维调整(LT-Tuning)框架,通过重新定义潜在思维构建与部署方式,引入上下文预测融合机制,结合三阶段课程学习,实现潜在与显式思维模式动态切换,优于现有潜在推理基线,有效缓解特征崩溃并提升推理精度。

Comments In Proceedings of the Forty-third International Conference on Machine Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09097 2026-07-13 cs.AI 版本更新 77%

Programming over Thinking: Efficient and Robust Multi-Constraint Planning

编程而非思考:高效且稳健的多约束规划

Derrick Goh Xin Deik, Quanyu Long, Zhengyuan Liu, Nancy F. Chen, Wenya Wang

机构 * Nanyang Technological University(南洋理工大学) Agency for Science, Technology and Research(科技研究局)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 多约束规划面临挑战,现有大语言模型方法有局限。本文提出SCOPE框架,将特定查询推理与通用代码执行分离,产生一致、可重用的求解器函数,降低成本和延迟,性能达最优。

Comments Accepted at ACL 2026 : Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00726 2026-07-13 cs.AI 版本更新 70%

Latent Reward Steering: An Adaptive Inference-Time Framework that Implicitly Promotes Cognitive Behaviors in Reasoning LLMs

潜在奖励引导:一种自适应推理时框架,隐式促进推理大语言模型中的认知行为

Jiakang Li, Guanyu Zhu, Can Jin, Chenxi Huang, Dexu Yu, Ronghao Chen, Yang Zhou, Hongwu Peng, Xuanqi Lan, Dimitris N. Metaxas, Youhua Li

机构 * Rutgers University(罗格斯大学) South China Agricultural University(华南农业大学) Columbia University(哥伦比亚大学) Fenz.AI QuantaAlpha Adobe Santa Clara University(圣克拉拉大学) City University of Hong Kong(香港城市大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出潜在奖励引导(LRS)框架,通过优化稀疏自编码器潜在状态隐式促进认知行为,利用最终答案正确性训练潜在奖励模型估计中间状态质量,并在推理时提供状态特定的修正方向,实验表明该方法能提升推理性能并修复原始推理错误。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.05559 2026-07-13 cs.AI 版本更新 70%

IFAR: Multi-Perspective and Multi-Level Causal Discovery with LLMs

IFAR:基于大语言模型的多视角多层次因果发现

Jinwei He, Feng Lu

机构 * Beihang University(北航大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对大语言模型溯因推理中多视角多层次原因这一挑战,提出IFAR框架,结合广义反向推理与正向验证,构建专门数据集,实验表明该框架能提升大语言模型溯因推理性能,在F1分数等方面有显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29943 2026-07-13 cs.CV 版本更新 67%

Diagnosing Long-Video Quantitative Reasoning in Multimodal LLMs via Enumeration and Counting

EC-Bench:超长视频的枚举与计数基准

Fumihiko Tsuchiya, Taiki Miyanishi, Shunsuke Yasuki, Mahiro Ukai, Nakamasa Inoue, Shuhei Kurita, Yusuke Iwasawa, Yutaka Matsuo

机构 * The University of Tokyo, Japan(东京大学) Institute of Science Tokyo, Japan(东京科学大学) National Institute of Informatics, Japan(国立信息学研究所)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 EC-Bench针对超长视频的枚举与计数问题,通过152部超过30分钟的视频和1699个查询,评估多模态大语言模型的性能,揭示模型在时间推理和计数任务中的局限性。

Comments The first two authors are equally contributed. The data and code are publicly available at: https://github.com/matsuolab/EC-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23449 2026-07-13 cs.AI cs.CR cs.SE 版本更新 57%

Beyond Embeddings: Interpretable Feature Extraction for Binary Code Similarity

超越嵌入:用于二进制代码相似性的可解释特征提取

Charles E. Gagnon, Steven H. H. Ding, Philippe Charland, Benjamin C. M. Fung

机构 * Defence Research and Development Canada(加拿大国防研究与发展署) McGill University(麦吉尔大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 研究二进制代码相似性检测问题,利用基于语言模型的智能体对汇编代码结构化推理分析生成可解释特征,无需匹配训练,在跨架构和跨优化任务中召回率表现良好,结合嵌入优于现有技术,实现准确性、可扩展性和可解释性共存。

Comments 15 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 评测与基准 7 篇

2510.03595 2026-07-13 cs.CL 版本更新 89%

Decoupling Task-Solving and Output Formatting in LLM Generation

在大语言模型生成中解耦任务解决与输出格式

Haikang Deng, Po-Nien Kung, Nanyun Peng

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究针对大语言模型任务指令与格式要求交织致性能下降的问题,提出解耦框架Deco-G,将格式遵循委托给单独模块,引入指令感知蒸馏等三项创新,实验证明其优于基线方法,能保证格式符合。

Comments Update to the latest ACL published version and add a link to the released code

Journal ref Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), Association for Computational Linguistics, 2026, pp. 16764-16781

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20064 2026-07-13 cs.PL cs.AI cs.CR 版本更新 81%

The LLMbda Calculus: AI Agents, Conversations, and Information Flow

LLMlambda 计算:人工智能代理、对话与信息流

Zac Garby, Andrew D. Gordon, David Sands

机构 * University of Nottingham, UK(诺丁汉大学) University of Edinburgh, UK(爱丁堡大学) Chalmers University of Technology(查尔姆斯理工大学) The University of Gothenburg, Sweden(哥德堡大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种无类型的lambda计算模型,用于形式化描述和验证人工智能代理中对话和信息流的安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05711 2026-07-13 cs.CV 版本更新 78%

Any to Full: Prompting Depth Anything for Depth Completion in One Stage

任何到完整:提示深度任何物以完成深度估计的一阶段

Zhiyuan Zhou, Ruofeng Liu, Taichi Liu, Weijian Zuo, Shanshan Wang, Zhiqing Hong, Desheng Zhang

机构 * Rutgers University(罗格斯大学) Michigan State University(密歇根州立大学) JD Logistics(京东物流) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 评测与基准 :prompting(title,abstract)

AI总结 Any2Full提出一种单阶段深度完成框架,通过尺度提示适应预训练MDE模型,提升鲁棒性和效率,优于现有方法。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.09076 2026-07-13 cs.CV 版本更新 78%

ProSGNeRF: Progressive Dynamic Neural Scene Graph with Frequency Modulated Foundation Model in Urban Scenes

ProSGNeRF:城市场景中基于频率调制基础模型的渐进式动态神经场景图

Tianchen Deng, Yanbo Wang, Yejia Liu, Chenpeng Su, Jingchuan Wang, Danwei Wang, Shao-Yuan Lo, Weidong Chen

机构 * Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) National Taiwan University(国立台湾大学)

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 针对大规模城市场景中快速移动对象建模及相机自我运动处理难题,提出ProSGNeRF,通过渐进式场景图网络架构学习局部场景表示,利用基础模型网络编码潜码并引入频率调制模块,提升视图合成等能力。

Comments Accepted by IJCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12920 2026-07-13 cs.MA cs.AI cs.CL 版本更新 73%

Embodied Multi-Agent Coordination by Aligning World Models Through Dialogue

通过对话对齐世界模型实现具身多智能体协调

Vardhan Dongre, Dilek Hakkani-Tür

机构 * Siebel School of Computing & Data Science(计算机与数据科学学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 研究通过对话机制探索具身智能体的世界模型对齐,发现对话能减少冲突但降低任务成功率,提出评估世界模型对齐的框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01480 2026-07-13 cs.AI physics.comp-ph 版本更新 70%

A Self-Evolving Agentic Framework for Metasurface Inverse Design

一种自演化代理框架用于超材料逆向设计

Yi Huang, Bowen Zheng, Yunxi Dong, Hong Tang, Huan Zhao, S. M. Rakibul Hasan Shawon, Hualiang Zhang

机构 * University of Massachusetts Lowell(马萨诸塞大学洛厄尔分校)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种自演化代理框架,通过上下文级技能进化解决超材料逆向设计中工作流构建的难题,提升任务成功率并减少尝试次数,实现可重用的求解器专业知识积累。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22313 2026-07-13 cs.LG 版本更新 70%

Hair-Trigger Alignment: Black-Box Evaluation Cannot Guarantee Post-Update Alignment

触发式对齐:黑盒评估无法保证更新后对齐

Yavuz Bakman, Duygu Nur Yaldiz, Eleni Triantafillou, Peter Kairouz, Salman Avestimehr, Sai Praneeth Karimireddy

机构 * University of Southern California(南加州大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究大语言模型更新后对齐问题,指出静态黑盒评估有局限,无法保证更新后对齐,通过理论分析和多领域实证验证,揭示模型隐藏对抗行为及与模型规模的关系,强调更新后鲁棒对齐评估的迫切性。

详情

展开后加载摘要…

URL PDF HTML 收藏