arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-14 至 2026-07-14 共收录 482 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 116 篇

2607.10059 2026-07-14 cs.AI 新提交 87%

AgentAbstain: Do LLM Agents Know When Not to Act?

AgentAbstain:基于大语言模型的智能体知道何时不行动吗?

Xun Liu, Yi Evie Zhang, Vira Kasprova, Parisa Rabbani, Pardis Sadat Zahraei, Tianyu Zhang, Ali Ebrahimpour-Boroojeny, Varun Chandrasekaran

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究基于大语言模型的智能体何时应弃权的问题,提出AgentAbstain评估框架及AbstainGen全自动管道,通过配对任务基准测试多种前沿LLMs,发现弃权能力与任务解决能力无关,并识别出失败模式,代码和数据集开源。

Comments 56 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19274 2026-07-14 cs.CL 版本更新 87%

HarDBench: A Benchmark for Draft-Based Co-Authoring Jailbreak Attacks for Safe Human-LLM Collaborative Writing

HarDBench: 面向安全人机协作写作的基于草稿的合著越狱攻击基准

Euntae Kim, Soomin Han, Buru Chang

机构 * Korea University(韩国大学) Sogang University(ソガン大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 提出HarDBench基准,评估大语言模型在协作写作中面对恶意草稿填充的越狱攻击的鲁棒性,并通过偏好优化实现安全-效用平衡的对齐方法。

Comments ACL 2026 Main

Journal ref Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pages 40785-40831 July 2-7, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11363 2026-07-14 cs.CL cs.AI 新提交 87%

Beyond Sally-Anne: Evaluating Theory of Mind in LLMs using Epistemic Schelling Points

超越莎莉-安妮任务:使用认知谢林点评估大语言模型中的心理理论

Roberta Rocca, Sami Boukortt, Geoff Keeling, Winnie Street

机构 * Paradigms of Intelligence Team(智能范式团队)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究旨在解决大语言模型心理理论评估问题,引入认知不对称谢林任务,通过要求模型在不同认知透明度下收敛于语义谢林点来评估其功能性ToM能力,发现能力差距及协调失败原因,指出社会推理和认知跟踪是瓶颈,为LLM评估与发展提供目标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10286 2026-07-14 cs.AI cs.MA 新提交 86%

Can Agentic Trading Systems Pay for Their Own Intelligence?

智能交易系统能否为自身智能付费?

Qiqi Duan, Changlun Li, Chen Wang, Fan Zhang, Mengxiang Wang, Dayi Miao, Peixian Ma, Jiangpeng Yan, Liyuan Chen, Shuoling Liu, Preslav Nakov, Yuyu Luo, Nan Tang

机构 * HKUST(GZ)(香港科技大学(广州)) Paradoox AI(悖论人工智能公司) E Fund Management Co., Ltd(易方达基金管理有限公司) MBZUAI(Mohamed Bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)) The University of Tokyo(东京大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究基于LLM的交易系统中智能体能否为自身智能付费的问题,引入TradeLens工具包进行评估,通过多方面分析发现可行性取决于智能到利润的转化,不同模型有不同失败模式,重构了此类交易智能体的评估方式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11414 2026-07-14 cs.CL 新提交 85%

Confidently Wrong: Detecting Hallucinations in Financial Question Answering from LLM Internal States

自信地犯错:从大语言模型内部状态中检测金融问答中的幻觉

Richard Zhe Wang

机构 * St. John Fisher University(圣约翰费舍尔大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究金融应用中LLMs自信却错误答案(自信幻觉)的检测,通过在残差流训练线性探测器并在FinQA和TAT-QA基准评估,发现探测器检测幻觉优势明显,可作为经济高效分类机制用于高风险金融应用答案审查。

Comments 8 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10112 2026-07-14 cs.CR cs.AI 新提交 85%

Minionese: Comprehensive Benchmark and Mechanistic Study of Multilingual LLM Safety

Minionese:多语言大语言模型安全性的综合基准测试与机理研究

Chigozirim Ifebi, Brent Kong, Ayushi Mehrotra

机构 * California Institute of Technology(加州理工学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究多语言大语言模型安全对齐问题,引入涵盖多种语言、资源层级和扰动类型的Minionese基准测试及几何机理分析,发现不同攻击类型漏洞特征不同,指出仅英语安全评估不足,需考虑多因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02951 2026-07-14 cs.CL cs.AI 版本更新 85%

How Annotation Trains Annotators: Competence Development in Social Influence Recognition

标注如何训练标注者:社会影响识别中的能力发展

Maciej Markiewicz, Beata Bajcar, Wiktoria Mieleszczenko-Kowszewicz, Aleksander Szczęsny, Tomasz Adamczyk, Grzegorz Chodak, Karolina Ostrowska, Aleksandra Sawczuk, Jolanta Babiak, Jagoda Szklarczyk, Przemysław Kazienko

机构 * Wrocław University of Science and Technology(弗罗茨瓦夫科技大学) University of Silesia in Katowice(卡托维兹西里西亚大学) SWPS University(SWPS大学)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了标注过程中标注者能力的变化,通过分析25名标注者对1021条对话的标注,发现标注者自我感知能力提升,专家组效果更显著,影响了基于其标注数据训练的LLM性能。

Comments Accepted to AIED 2026 (27th Conference on Artificial Intelligence in Education)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11517 2026-07-14 cs.CR 新提交 85%

Graph-Based Structural Evaluation of LLM-Translated Adversary Emulation Procedures

基于图的大语言模型翻译的对手模拟程序结构评估

Ahmed M. Elmisery

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究大语言模型翻译对手模拟程序的评估问题,核心方法是基于图的结构评估(GBSE),将程序建模为有向属性图并计算归一化图编辑距离,主要贡献是应用于跨平台计划评估,揭示技术差异,框架含多种工具和规则且结果可重现验证。

Comments This technical contribution supports the MITRE white paper titled: Evaluating LLMs for Impact-Faithful Translation of Adversary Behavior Across Operating Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06861 2026-07-14 cs.CL cs.AI 版本更新 84%

BiasLab: A Multilingual Dual-Framing Framework for LLM Bias Measurement, Applied to Workplace and HR Contexts

BiasLab:用于大语言模型偏差测量的多语言双框架框架,应用于职场和人力资源领域

William Guey, Wei Zhang, Pei-Luen Patrick Rau, Pierrick Bougault, Vitor D. de Moura, Bertan Ucar, Jose O. Gomes

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对大语言模型在工作场所和人力资源领域的偏差问题,提出BiasLab多语言双框架框架,结合多种方法对十个模型在六个主题上评估,发现模型有一致方向性偏好,为模型偏差测量提供标准化工具助组织审查。

Comments 15 pages, 4 figures, 6 tables

Journal ref Work: A Journal of Prevention, Assessment and Rehabilitation, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28925 2026-07-14 cs.LG cs.AI cs.IR cs.MA 版本更新 82%

Multi-Agent Routing as Set-Valued Prediction: A WildChat Benchmark and Cost-Aware Evaluation

多智能体路由作为集值预测:一个WildChat基准与成本感知评估

Ananto Nayan Bala, Faisal Muhammad Shah

机构 * Ahsanullah University of Science and Technology(阿萨努拉科学与技术大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 提出基于WildChat的多智能体路由基准,包含3000个提示和12个智能体目录,采用集值评估指标和成本感知加权路由,实验表明监督方法优于零样本LLM。

Comments 9 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11078 2026-07-14 cs.CV cs.AI 新提交 81%

Do Video-LLMs Actually Watch? Diagnosing Character-Tracking Failures in Long-Form Video

视频语言模型真的在观看吗?诊断长视频中的角色跟踪失败

Mohammad Al-Ratrout, Shayla Sharmin, Aditya Raikwar, Roghayeh Leila Barmaki

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究视频语言模型在长视频中跟踪角色的能力,通过九条件诊断协议测试三个开源模型及Gemini,发现模型准确性非来自角色跟踪,存在性别线索利用问题,还发布诊断工具包揭示基准分数衡量的实际情况。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17776 2026-07-14 cs.CL 版本更新 81%

DEER: A Benchmark for Evaluating Deep Research Agents on Expert Report Generation

DEER:用于评估深度研究代理在专家报告生成上的基准

Janghoon Han, Heegyu Kim, Changho Lee, Dahm Lee, Min Hyung Park, Hosung Song, Stanley Jungkyu Choi, Moontae Lee, Honglak Lee

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 DEER是一个用于评估深度研究代理在专家报告生成中性能的基准,通过系统化的评估标准和主张验证架构,提升报告质量和逻辑完整性。

Comments ICML 2026 (45 pages, 12 figures, 25 tables, 129 references

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21255 2026-07-14 cs.GT cs.AI math.OC 版本更新 81%

A General Equilibrium Theory of Orchestrated AI Agent Systems

一个 orchestrated AI agent 系统的一般均衡理论

Jean-Philippe Garnier

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种基于一般均衡理论的AI代理系统模型,通过集中编排实现系统福利最大化,并证明了均衡存在性和收敛性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11276 2026-07-14 cs.CL cs.AI cs.CY cs.MA 新提交 81%

Automated Textbook Auditing with Multi-Agent LLM Systems

使用多智能体大语言模型系统进行自动化教科书审核

Ciprian Cristescu, Adrian-Marius Dumitran, Angela-Liliana Dumitran, Gabriel Stefan

机构 * University of Bucharest(布加勒斯特大学) Dimitrie Cantemir Christian University(迪米特里·坎泰米尔基督教大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.AI

AI总结 研究旨在确保教材质量,提出人工智能教科书审核器这一多智能体管道,通过事实技术与语法双轨道分析生成报告,经判断智能体过滤误报,支持两种摄取模式且可领域适配,在两本教科书上验证可减少人工查找问题工作量。

Comments Presented @ iTextbooks 2026: 7th Workshop on Intelligent Textbooks at AIED'2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10694 2026-07-14 cs.LG cs.AI 新提交 81%

Learning to Fine-tune Foundation Models under Resource Limitations

在资源受限情况下学习微调基础模型

Thomas Tsouparopoulos, Iordanis Koutsopoulos

机构 * Athens University of Economics and Business(雅典经济与商业大学)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 研究资源受限设备上基础模型的最优持续微调问题,将其建模为约束马尔可夫决策过程,提出基于强化学习的演员评论家算法,实验表明该方法在准确率上优于同预算微调方法,且大幅减少微调步骤。

Comments 6 pages, 2 figures, 1 table, accepted and presented at ICMLCN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09739 2026-07-14 cs.AI cs.CL 新提交 81%

Coresets Before Score Sets: Evaluation-Unsupervised Prompt Subset Selection for LLM Benchmarks

分数集之前的核心集:用于大语言模型基准测试的评估无监督提示子集选择

Jihan Yao, Gantavya Bhatt, Arnav Das, Peter Jin, Ke Bao, Qiaolin Yu, Khushi Bhardwaj, Chang Su, Jialei Wang, Yikai Zhu, Sugam Devare, Damon Mosk-Aoyama, Zhen Dong, Venkat Krishna Srinivasan, Yineng Zhang, Oleksii Kuchaiev, Jiantao Jiao, Banghua Zhu, Jeff Bilmes

机构 * University of Washington(华盛顿大学) University of California, Berkeley(加利福尼亚大学伯克利分校) Oracle(甲骨文公司) Together AI(Together AI公司) LMSYS NVIDIA(英伟达公司)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型基准测试的核心集选择,采用评估无监督方法,利用次模子集选择,开发多种次模函数。在新大规模套件上实验发现设施选址函数效果好,该目标不限于特定模式,在相关排行榜上表现优且计算成本低,证明次模性对基准压缩有用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10197 2026-07-14 cs.AI 新提交 80%

GRATE: Temporal Extensions for Inductive KG Foundation Models via Gated Rotary Attention

GRATE:基于门控旋转注意力的归纳式知识图谱基础模型的时间扩展

Jiaxin Pan, Osama Mohammed, Daniel Hernández, Steffen Staab

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI

AI总结 研究如何将知识图谱基础模型的归纳迁移能力扩展到时间知识图谱,提出GRATE方法,通过门控旋转注意力编码时间,集成到NBFNet模型中,构建新基准套件测试,单个联合预训练的GRATE检查点在多数设置下优于静态基础模型。

Comments Accepted at the ICML 2026 Workshop on Graph Foundation Models: A New Era for Graph Machine Learning. 17 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11046 2026-07-14 cs.SE 新提交 80%

Retrieval-Oriented Code Representations in Agentic Bug Localization

面向检索的智能体漏洞定位中的代码表示

Genevieve Caumartin, Tse-Hsun, Chen, Diego Elias Costa

专题命中 评测与基准 :LLM(summary_cn,abstract)

AI总结 研究文件级漏洞定位中代码表示的作用,在LCA和SWE数据集上比较五种代码表示,通过实验发现角色感知摘要性价比最佳,结合互补结果和LLM排序可进一步提升效果,案例研究验证技术有效性,强调代码表示应是智能体定位管道的重要设计选择。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11643 2026-07-14 cs.RO cs.AI 新提交 79%

Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model

小米机器人-U0:基于世界基础模型的统一具身合成

Xinghang Li, Jun Guo, Qiwei Li, Long Qian, Hang Lai, Yueze Wang, Hongyu Yan, Jiahang Cao, Xi Chen, Jingen Qu, Jiaxi Song, Nan Sun, Hanye Zhao, Futeng Liu, Wanli Peng, Heyun Wang, Yunhong Wang, Caoyu Xia, Jack Zhao, Diyun Xiang, Hangjun Ye, Heng Qu, Huaping Liu, Jason Li

机构 * Xiaomi Robotics(小米机器人)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI

AI总结 研究针对基础模型应用于具身场景受限问题,提出小米机器人-U0多模态自回归模型,将具身生成扩展为基础图像和视频生成的形式,联合优化多种生成任务,在多方面取得领先成果,证明基础世界模型可用于具身智能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11564 2026-07-14 cs.CL cs.HC cs.IR 新提交 79%

PaperRouter-Agent: A Content-Grounded LLM Agent for Personalized Hierarchical Paper Routing

论文路由器-智能体:用于个性化分层论文路由的基于内容的语言模型智能体

Keshen Zhou, Lintao Wang, Suqin Yuan, Zhuqiang Lu, Yu Luo, Zhiyong Wang

机构 * University of Sydney(悉尼大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL

AI总结 研究个性化分层论文路由问题,提出无需训练基于文件夹成员决策的PaperRouter-Agent智能体,在真实个人图书馆和公共基准测试中,该智能体有效提升论文路由召回率和准确率,且成本低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11287 2026-07-14 cs.CV cs.AI 新提交 79%

A Unified Framework for Comprehensive Cardiac CT Segmentation and Phenotyping: Human-in-the-Loop Data Annotation, Vision Foundation Model Development, Multicenter Evaluation and Clinical Validation

用于心脏CT综合分割与表型分析的统一框架:人在回路数据标注、视觉基础模型开发、多中心评估及临床验证

Pooya Mohammadi Kazaj, Leo Fridolin Weber, Wen Xie, Seyed Amir Ahmad Safavi-Naini, Anselm Stark, Giovanni Baj, Ali Mokhtari, Toshiya Yoshida, Christoph Ryffel, Taishi Okuno, Yoshihiro Akashi, Ronny R. Buechel, Thomas Pilgrim, Waldo Valenzuela, George C. M. Siontis, Xiaowei Xu, Moritz Hundertmark, Stephan Windecker, Christoph Grani, Isaac Shiri

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI

AI总结 该研究提出统一框架用于心脏CT综合分割与表型分析,结合人在回路标注、增强技术与自监督预训练模型,组建大型数据集,在多数据集上表现优于开源工具,提高标注效率,推动心脏表型分析发展,还提供了可重复基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10846 2026-07-14 cs.CL 新提交 79%

Quantifying the Sources of Instability in LLM-Based Stance Analysis of Public Discourse

量化基于大语言模型的公共话语立场分析中的不稳定来源

Bo Chen

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL

AI总结 研究基于大语言模型的公共话语立场分析中不稳定来源,通过对256次YouTube采访比较两种说话人日记化管道和两种测量方法,发现问题并给出能区分管道与测量效应的诊断框架,强调研究结论需验证对两种变化来源的稳健性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10826 2026-07-14 cs.CV cs.AI cs.GR 新提交 79%

3D-DefectBench: A Controlled Factorial Study of Vision-Language Model Evaluation Pipelines for Fine-Grained 3D Generation Defects

3D-缺陷基准:用于细粒度3D生成缺陷的视觉语言模型评估管道的控制因子研究

Zhenyu Zhao, Nanshan Jia, Jihyeon Je, Yifu Tang, Alvin Chan, Michael Spedden, Michael V. Palleschi, Sui Huang, Jingshen Wang, Zeyu Zheng

机构 * Roblox Corporation(罗布乐思公司) Berkeley AI Research Lab & Department of Industrial Engineering and Operations Research, University of California, Berkeley(加州大学伯克利分校伯克利人工智能研究实验室及工业工程与运筹学系) Computer Science Department, Stanford University(斯坦福大学计算机科学系) Division of Biostatistics, University of California, Berkeley(加州大学伯克利分校生物统计学系)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 研究基于视觉语言模型的3D缺陷检测管道评估,引入3D-DefectBench基准框架,通过平衡因子设计改变多个管道因素进行实验,发现模型选择影响最大,各因素相互作用,还得出一些协议表现及评判与人工标注对比情况等结论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10626 2026-07-14 cs.CL 新提交 79%

Eval-Pair Matrix: Answer-Paired Meta-Evaluation of LLM Judges for Grounded RAG

评估对矩阵:基于事实的检索增强生成中大型语言模型评判器的答案配对元评估

Sriram Selvam, Anneswa Ghosh

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL

AI总结 研究针对基于事实的检索增强生成中大型语言模型评判器自我宽容难识别问题,引入Eval-Pair Matrix协议,通过特定流程生成答案并评估,经实验得出同模型效应等结果,强调RAG评判器研究应报告多方面内容。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10511 2026-07-14 cs.CL 新提交 79%

Articulate Intuition or Genuine Analysis? Benchmarking Epistemic Reliability in LLM-as-a-Judge Peer Reviews

清晰的直觉还是真正的分析?评估大语言模型作为评审员的同行评审中的认知可靠性基准

Nuo Chen, Qian Wang, Qingyun Zou, Bingsheng He

机构 * National University of Singapore(新加坡国立大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL

AI总结 研究大语言模型评审员与人类评审员对同行评审评估的差异,将卡尼曼双过程理论转化为评分标准并发布Kahneman4Review基准,通过多方面发现揭示问题,强调可靠基准应区分分析形式与认知功能并给出设计选择。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10487 2026-07-14 cs.CR cs.AI 新提交 79%

Temporary Authority, Permanent Effects: Commit-Time Authorization for LLM Agents

临时权限,永久影响:大型语言模型代理的提交时间授权

Igor Santos-Grueiro

机构 * International University of La Rioja(拉里奥ja国际大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 研究大型语言模型代理提交时间授权问题,构建受控失效套件实验,发现端点成功率高但授权完成率低,评估缓解措施,提出CommitGuard可阻止过时持久影响尝试,指出端点成功是实用指标,授权提交是安全属性。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07405 2026-07-14 cs.AI cs.CR 版本更新 79%

Reason Less, Verify More: Deterministic Gates Recover a Silent Policy-Violation Failure Mode in Tool-Using LLM Agents

少些推理,多些验证:确定性门控在使用工具的语言模型智能体中恢复了一种无声的违反策略失败模式

Vikas Reddy, Sumanth Reddy Challaram, Abhishek Basu

机构 * Indian Institute of Technology Kharagpur(印度理工学院卡拉格布尔分校) Massachusetts Institute of Technology(麻省理工学院)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 研究使用工具的语言模型智能体违反策略问题,提出用确定性预执行门控干预,在τ²基准航空公司领域评估,该方法能提高成功率,防止无声违反策略写入,虽不保证任务成功,但有可靠性成果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10720 2026-07-14 cs.AI cs.LG cs.MA 新提交 79%

WattCouncil: Context-Aware Household Energy Scenario Generation With Governed LLMs

瓦特委员会:基于受治理大语言模型的情境感知家庭能源情景生成

Mohannad Takrouri, Nicolas M. Cuadrado A., Martin Takáč

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对智能电网因数据受限发展受阻的问题,提出瓦特委员会框架,利用基于大语言模型的代理,在文化、时间和物理等约束下生成家庭能源情景,经实验评估及消融研究验证了其有效性和一致性。

Comments 11 pages, 5 figures

Journal ref The 13th ACM International Conference on Systems for Energy-Efficient Buildings, Cities, and Transportation (BuildSys 26), June 22-25, 2026, Banff, AB, Canada. ACM, New York, NY, USA, 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10628 2026-07-14 cs.CL cs.AI cs.HC 新提交 79%

Anamnesis: An Open-Source Platform for Large-Scale Backstory-Conditioned Survey Simulation

记忆回溯:一个用于大规模背景条件调查模拟的开源平台

Song-Ze Yu, Joseph Suh, Serina Chang, David M. Chan

机构 * University of California, Berkeley(加利福尼亚大学伯克利分校)

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 介绍开源平台记忆回溯,用于大规模背景条件调查模拟。它运用大语言模型,基于文集和他性框架,支持多模态调查。通过案例研究评估,其产生的意见分布更接近真实数据,为专有模拟服务提供替代。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23386 2026-07-14 cs.CL cs.AI 79%

Causal2Vec: Improving Decoder-only LLMs as Embedding Models through a Contextual Token

Causal2Vec:通过上下文标记提升解码器-only LLMs作为嵌入模型

Ailiang Lin, Zhuoyun Li, Yusong Wang, Kotaro Funakoshi, Manabu Okumura

机构 * Institute of Science Tokyo(东京科学研究所) Tencent(腾讯)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 Causal2Vec通过引入上下文标记提升解码器-only LLMs的嵌入性能,无需修改原有架构或增加计算开销,实现了在MTEB基准上的新状态。

详情

展开后加载摘要…

URL PDF HTML 收藏