arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-22 至 2026-04-22 共收录 32 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 32 篇

2604.19638 2026-04-22 cs.AI cs.CL cs.RO 84%

SafetyALFRED: Evaluating Safety-Conscious Planning of Multimodal Large Language Models

SafetyALFRED:评估多模态大语言模型的安全意识规划

Josue Torres-Fonseca, Naihao Deng, Yinpei Dai, Shane Storks, Yichi Zhang, Rada Mihalcea, Casey Kennington, Joyce Chai

机构 * University of Michigan(密歇根大学) Boise State University(博伊西州立大学)

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出SafetyALFRED,基于ALFRED基准测试,引入六类厨房真实世界危险,评估多模态大语言模型在安全意识规划中的表现,发现静态QA评估不足,需转向强调具身环境中的纠正行动的基准。

Comments Work accepted at ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22737 2026-04-22 cs.CV 82%

Lingua-SafetyBench: A Benchmark for Safety Evaluation of Multilingual Vision-Language Models

Lingua-SafetyBench: 一个多语言视觉-语言模型安全评估基准

Enyi Shi, Pengyang Shao, Yanxin Zhang, Chenhang Cui, Jiayi Lyu, Xiaobo Xia, Fei Shen, Tat-Seng Chua

机构 * School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院) School of Computer Science, University of Wisconsin–Madison(威斯康星大学麦迪逊分校计算机科学系) School of Engineering Science, University of the Chinese Academy of Sciences(中国科学院工程科学学院) NExT++ Research Centre, National University of Singapore(新加坡国立大学NExT++研究中心)

专题命中 安全评测 :safety(title,abstract);alignment(abstract)

AI总结 本文提出Lingua-SafetyBench,通过10万多个多语言图像-文本对评估多模态模型的安全性,发现非高资源语言和非拉丁文在文本主导风险下安全性更差,强调需要专门的语言和模态对齐策略以提升安全性和公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19457 2026-04-22 cs.AI 80%

Four-Axis Decision Alignment for Long-Horizon Enterprise AI Agents

四轴决策对齐用于长周期企业AI代理

Vasundra Srininvasan

机构 * Vasundra Srinivasan

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出四轴对齐框架,用于评估长周期企业AI代理的决策行为,涵盖事实精度、推理连贯性、合规重建和校准回避,通过实验揭示了决策对齐的重要性。

Comments 21 pages, 5 figures, 8 tables. PDFLaTeX. Code and artifacts: https://github.com/vasundras/decision-alignment-long-horizon-agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18850 2026-04-22 cs.HC cs.AI cs.SI 80%

The Triadic Loop: A Framework for Negotiating Alignment in AI Co-hosted Livestreaming

三元循环:一种协商AI共播直播中对齐的框架

Katherine Wang, Nadia Berthouze, Aneesha Singh

机构 * University College London(伦敦大学学院)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出三元循环框架,用于协商AI共播直播中的对齐问题,通过三者之间的双向适应过程,解决多用户社交环境中的动态反馈循环问题。

Comments 6 pages, 1 figure, Proceedings the Human-AI Interaction Alignment Workshop at CHI 2026 (CHI26 BiAlign Workshop)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18757 2026-04-22 cs.CV cs.AI 79%

REVEAL: Multimodal Vision-Language Alignment of Retinal Morphometry and Clinical Risks for Incident AD and Dementia Prediction

REVEAL:多模态视图-语言对齐的视网膜形态学与临床风险预测

Seowung Leem, Lin Gu, Chenyu You, Kuang Gong, Ruogu Fang

机构 * J. Crayton Pruitt Family Department of Biomedical Engineering, University of Florida(佛罗里达大学J. Crayton Pruitt家族生物医学工程系) Research Institute of Electrical Communication, Tohoku University(东北大学电气通信研究所) Department of Applied Mathematics & Statistics, Stony Brook University(石溪大学应用数学与统计学系) Department of Computer Science, Stony Brook University(石溪大学计算机科学系)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

AI总结 REVEAL通过多模态对齐视网膜形态学与临床风险因素,提前8年预测阿尔茨海默病和痴呆症,优于现有模型。

Comments Accepted for publication a MIDL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00439 2026-04-22 cs.CL 79%

Improving the Distributional Alignment of LLMs using Supervision

通过监督改进大型语言模型的分布对齐

Gauri Kambhatla, Sanjana Gautam, Angela Zhang, Alex Liu, Ravi Srinivasan, Junyi Jessy Li, Matthew Lease

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

AI总结 本文通过简单监督提升LLM在不同群体上的分布对齐,分析了三个数据集的对齐效果,并为未来研究提供基准。

Comments ACL Main 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19281 2026-04-22 cs.HC cs.AI cs.CL cs.LG 75%

Beyond Semantic Similarity: A Component-Wise Evaluation Framework for Medical Question Answering Systems with Health Equity Implications

超越语义相似性:面向医疗问答系统的组件评估框架及其健康公平性影响

Abu Noman Md Sakib, Md. Main Oddin Chisty, Zijie Zhang

机构 * University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校) Khulna University of Engineering and Technology(库尔纳工程科技大学)

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出VB-Score框架,评估医疗问答模型的四个组件,揭示模型在慢性病等特定群体中的性能差异,指出语义评估不足以确保医疗AI的安全性。

Comments Accepted in the Ninth Annual ACM Conference on Fairness, Accountability, and Transparency (ACM FAccT) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18756 2026-04-22 cs.LG cs.AI cs.CL cs.CR 75%

Towards Understanding the Robustness of Sparse Autoencoders

迈向稀疏自编码器鲁棒性的理解

Ahson Saiyed, Sabrina Sadiekh, Chirag Agarwal

机构 * University of Virginia(弗吉尼亚大学) Independent Researcher(独立研究者)

专题命中 安全评测 :jailbreak(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过在推理阶段集成预训练的稀疏自编码器,发现其能显著降低对抗攻击成功率,并揭示稀疏性与攻击成功率之间的剂量-反应关系,以及层间防御与性能的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19016 2026-04-22 cs.CL 70%

AlignCultura: Towards Culturally Aligned Large Language Models?

AlignCultura: 向文化对齐的大语言模型迈进?

Gautam Siddharth Kashyap, Mark Dras, Usman Naseem

机构 * School of Computing, Macquarie University, Australia(麦考瑞大学计算机学院,澳大利亚)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.CL

AI总结 本文提出AlignCultura框架,通过构建HHH-English数据集和评估不同模型的文化对齐能力,提升输出的尊重性和文化多样性。

Comments Accepted at ACL Mains 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19206 2026-04-22 cs.CV 67%

When Can We Trust Deep Neural Networks? Towards Reliable Industrial Deployment with an Interpretability Guide

当我们可以信任深度神经网络?迈向可靠工业部署的可解释性指南

Hang-Cheng Dong, Yuhao Jiang, Yibo Jiao, Lu Zou, Kai Zheng, Bingguo Liu, Dong Ye, Guodong Liu

专题命中 安全评测 :safety(abstract);trustworthy(abstract)

AI总结 本文提出一种基于事后解释的指标,用于检测二分类缺陷检测网络中的假阴性,通过计算类别特定判别热图与类别无关热图的交并比差异作为可靠性评分,并引入对抗增强方法以放大差异,实验证明该方法能有效识别假阴性,尽管牺牲了真阴性率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05540 2026-04-22 cs.RO cs.AI cs.CV cs.LG cs.NE 62%

Constructing the Umwelt: Cognitive Planning through Belief-Intent Co-Evolution

构建环境:通过信念-意图共演的认知规划

Shiyao Sang

机构 * Shiyao Sang(桑世尧)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于信念-意图共演的认知规划方法,通过MBCWM和TIWM模型实现环境与现实的认知一致性,提升自动驾驶规划性能并展现类人认知行为。

Comments 12 pages, 8 figures. A paradigm shift from reconstructing the world to understanding it: planning through Belief-Intent Co-Evolution

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24803 2026-04-22 cs.LG cs.AI 62%

TimeOmni-1: Incentivizing Complex Reasoning with Time Series in Large Language Models

TimeOmni-1:通过时间序列激励大型语言模型的复杂推理

Tong Guan, Zijie Meng, Dianqi Li, Shiyu Wang, Chao-Han Huck Yang, Qingsong Wen, Zuozhu Liu, Sabato Marco Siniscalchi, Ming Jin, Shirui Pan

机构 * Griffith University(格里菲斯大学) Zhejiang University(浙江大学) NVIDIA(英伟达) Squirrel Ai Learning University of Palermo(帕尔米奥大学) Norwegian University of Science and Technology(挪威科学技术大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出TimeOmni-1,首个统一推理模型,通过时间序列推理解决多样化现实问题,提升因果发现和有效响应率。

Comments Accepted by the 14th International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.04410 2026-04-22 cs.AI cs.HC cs.IR cs.LG 62%

User Simulation in the Era of Generative AI: User Modeling, Synthetic Data Generation, and System Evaluation

生成AI时代用户模拟:用户建模、合成数据生成与系统评估

Krisztian Balog, ChengXiang Zhai

机构 * University of Stavanger(斯塔万格大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨生成AI时代用户模拟的跨学科应用,提出从传统预测模型向生成方法转变,并强调伦理考量与AGI追求的理论联系,建立学术与产业的创新生态系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18867 2026-04-22 cs.CV cs.AI cs.LG 62%

Hierarchically Robust Zero-shot Vision-language Models

层次化鲁棒零样本视觉-语言模型

Junhao Dong, Yifei Zhang, Hao Zhu, Yew-Soon Ong, Piotr Koniusz

机构 * Nanyang Technological University(南洋理工大学) CFAR, IHPC, A*STAR(CFAR、IHPC、A*STAR) Northwest Polytechnical University(西北工业大学) Data61 CSIRO University of New South Wales(新南威尔士大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于层次嵌入的鲁棒微调框架,提升视觉-语言模型对对抗攻击的鲁棒性,通过多级对抗对齐和层次嵌入深度控制,增强模型泛化能力与语义多样性。

Comments This paper is accepted by CVPR'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18715 2026-04-22 cs.CL cs.AI 62%

Characterizing AlphaEarth Embedding Geometry for Agentic Environmental Reasoning

表征AlphaEarth嵌入几何用于代理环境推理

Mashrekur Rahman, Samuel J. Barrett, Christina Last

机构 * Dartmouth Libraries(达特茅斯图书馆) Dartmouth College(达特茅斯学院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文研究AlphaEarth嵌入几何结构,开发代理系统用于环境推理,发现其非欧几里得特性及检索优于线性方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15832 2026-04-22 cs.CL cs.AI 62%

A Functionality-Grounded Benchmark for Evaluating Web Agents in E-commerce Domains

面向电商领域的功能导向基准评估Web代理

Xianren Zhang, Shreyas Prasad, Di Wang, Qiuhai Zeng, Suhang Wang, Wenbo Yan, Mat Hans

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) Amazon(亚马逊)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Amazon-Bench基准,旨在评估电商领域Web代理的功能性和安全性,通过生成涵盖地址管理、心愿单管理等任务的用户查询,发现现有代理在复杂任务中表现不足且存在安全风险。

Comments 8 pages for main body and 8 pages of appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19538 2026-04-22 cs.AI cs.HC cs.MA 57%

Integrating Anomaly Detection into Agentic AI for Proactive Risk Management in Human Activity

将异常检测整合到代理AI中以实现人类活动中的主动风险管理

Farbod Zorriassatine, Ahmad Lotfi

机构 * Department of Computer Science(计算机科学系) Nottingham Trent University(诺丁汉特伦特大学) Nottingham, UK(英国诺丁汉)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文提出将跌倒检测与预测作为异常检测问题,通过代理AI系统提升对复杂环境的适应能力,以实现更有效的风险管理工作。

Comments 6 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19516 2026-04-22 cs.AI 57%

From Experience to Skill: Multi-Agent Generative Engine Optimization via Reusable Strategy Learning

从经验到技能:通过可重用策略学习的多智能体生成引擎优化

Beining Wu, Fuyou Mao, Jiong Lin, Cheng Yang, Jiaxuan Lu, Yifu Guo, Siyu Zhang, Yifan Wu, Ying Huang, Fu Li

机构 * Hangzhou Dianzi University(杭州电子科技大学) Central South University(中南大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Sun Yat-sen University(中山大学) Ramus Hong Kong University of Science and Technology (GuangZhou)(香港科技大学(广州))

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本文提出MAGEO框架,通过协调规划、编辑和基于保真的评估,实现生成引擎优化,结合双轴指标DSV-CF和双分支评估协议,提升内容编辑的语义可见性和归因准确性。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19405 2026-04-22 cs.CL 57%

Lost in Translation: Do LVLM Judges Generalize Across Languages?

迷失在翻译中:大型视觉-语言模型(LVLM)的评判者是否能跨语言泛化?

Md Tahmid Rahman Laskar, Mohammed Saidul Islam, Mir Tafseer Nayeem, Amran Bhuiyan, Mizanur Rahman, Shafiq Joty, Enamul Hoque, Jimmy Huang

机构 * York University(约克大学) University of Alberta(阿尔伯塔大学) Nanyang Technological University(南洋理工大学) Salesforce AI Research(Salesforce AI研究)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出MM-JudgeBench,首个多语言多模态评判模型评估基准,包含60000+跨25种语言的配对偏好实例,揭示了LVLM评判器在跨语言性能上的显著差异,指出模型大小和架构并非多语言鲁棒性的良好预测因素。

Comments Accepted at ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19342 2026-04-22 cs.CL 57%

Are Large Language Models Economically Viable for Industry Deployment?

大语言模型在工业部署中经济上可行吗?

Abdullah Mohammad, Sushant Kumar Ray, Pushkar Arora, Rafiq Ali, Ebad Shabbir, Gautam Siddharth Kashyap, Jiechao Gao, Usman Naseem

机构 * DSEU-Okhla University of Delhi(德里大学) Macquarie University(麦考瑞大学) Center for SDGC(SDGC研究中心) Stanford University(斯坦福大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 本文提出EDGE-EVAL框架,评估大语言模型在工业场景中的全生命周期性能,引入五个部署指标,揭示模型在经济性和能效上的效率前沿及异常现象。

Comments Accepted at ACL 2026 (Industry Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11665 2026-04-22 cs.CL 57%

Multi-Task Reinforcement Learning for Enhanced Multimodal LLM-as-a-Judge

多任务强化学习用于增强多模态大语言模型作为裁判

Junjie Wu, Xuan Kan, Zihao He, Shunwen Tan, Bo Pan, Kaitai Zhang

机构 * Meta AI Hong Kong University of Science and Technology(香港科技大学) Emory University(埃默里大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出MT-RL-Judge框架,通过多任务强化学习优化多模态大语言模型作为裁判,提升判断一致性和与人类偏好的相关性,并在分布外任务中展现鲁棒泛化能力。

Comments ACL 2026 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02779 2026-04-22 cs.CV cs.AI 57%

3D Foundation Model for Generalizable Disease Detection in Head Computed Tomography

用于头部CT图像通用疾病检测的3D基础模型

Weicheng Zhu, Haoxu Huang, Huanze Tang, Rushabh Musthyala, Boyang Yu, Long Chen, Emilio Vega, Thomas O'Donnell, Seena Dehkharghani, Jennifer A. Frontera, Arjun V. Masurkar, Kara Melmed, Narges Razavian

机构 * New York University, Center for Data Science(纽约大学数据科学中心) New York University, Courant Institute of Mathematical Sciences(纽约大学Courant数学科学研究所) NYU Grossman School of Medicine, Department of Radiology(纽约大学 Grossman 医学院放射科) Siemens Healthineers(西门子医疗科技) NYU Grossman School of Medicine, Department of Neurology(纽约大学 Grossman 医学院神经病学部) NYU Grossman School of Medicine, Department of Neuroscience and Physiology(纽约大学 Grossman 医学院神经科学与生理学部) NYU Grossman School of Medicine, Neuroscience Institute(纽约大学 Grossman 医学院神经科学研究所)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文提出FM-CT模型,通过自监督学习在无需人工标注的情况下训练,提升头部CT图像中疾病检测的泛化能力,验证了自监督学习在医学影像中的有效性。

Comments Nature Biomedical Engineering (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18660 2026-04-22 cs.CR cs.AI 57%

Evaluating Answer Leakage Robustness of LLM Tutors against Adversarial Student Attacks

评估LLM导师对对抗性学生攻击的答案泄露鲁棒性

Jin Zhao, Marta Knežević, Tanja Käser

机构 * EPFL(瑞士联邦理工学院)

专题命中 安全评测 :jailbreak(abstract);分类 cs.AI

AI总结 本文研究了学生对抗性攻击下LLM导师的答案泄露鲁棒性,评估了多种模型在对抗攻击下的表现,并提出标准化基准和防御策略。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04713 2026-04-22 cs.HC cs.AI cs.CV 57%

Adaptive Prompt Elicitation for Text-to-Image Generation

自适应提示引导用于文本到图像生成

Xinyi Wen, Lena Hegemann, Xiaofu Jin, Shuai Ma, Antti Oulasvirta

机构 * Aalto University \& University of Helsinki \& ELLIS Institute Finland Helsinki Finland Aalto University Helsinki Finland Aalto University \& ELLIS Institute Finland Helsinki Finland Aalto University \& University of Helsinki \& ELLIS Institute Finland Aalto University Aalto University \& ELLIS Institute Finland

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出自适应提示引导技术,通过交互式意图推断框架提升文本到图像生成与用户意图的对齐效率,实验表明其在准确性和效率上均优于现有方法。

Comments 25 pages, 14 figures, ACM IUI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15755 2026-04-22 cs.CL 57%

Beyond Marginal Distributions: A Framework to Evaluate the Representativeness of Demographic-Aligned LLMs

超越边缘分布:评估与文化价值观对齐的大型语言模型代表性的框架

Tristan Williams, Franziska Weeber, Sebastian Padó, Alan Akbik

机构 * Humboldt University of Berlin(柏林洪堡大学) University of Stuttgart(斯图加特大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出评估对齐模型代表性的框架,通过多变量相关性模式和边缘分布相结合,比较两种模型引导技术,发现尽管细调模型更接近边缘分布,但提示方法在再现调查项目相关性结构上更优,但两者均未与人类相关性模式一致。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15907 2026-04-22 cs.CL 57%

TabReX : Tabular Referenceless eXplainable Evaluation

TabReX : 不依赖参考的表格可解释性评估

Tejas Anvekar, Junha Park, Aparna Garimella, Vivek Gupta

机构 * Arizona State University(亚利桑那州立大学) Adobe Research(Adobe研究)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

AI总结 TabReX 提出了一种不依赖参考的表格生成评估框架,通过图推理方法将源文本和生成表格转化为知识图谱,并计算可解释的评分,实现结构和事实的准确性评估。

Comments Accepted to ACL 2026 (Main Conference). Long paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09427 2026-04-22 cs.AR cs.AI 57%

ODMA: On-Demand Memory Allocation Strategy for LLM Serving on LPDDR-Class Accelerators

ODMA:面向LLM服务的LPDDR类加速器按需内存分配策略

Guoqiang Zou, Wanyu Wang, Hao Zheng, Longxiang Yin, Yinhe Han

机构 * University of Chinese Academy of Sciences(中国科学院大学) Beijing Information Science and Technology University(北京信息科技大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 ODMA针对LPDDR类加速器的随机访问带宽限制,提出按需内存分配策略,通过动态调整内存桶边界和安全池提升KV缓存利用率和吞吐量。

Comments 4 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10899 2026-04-22 cs.CL cs.LO cs.SE 57%

From Proof to Program: Characterizing Tool-Induced Reasoning Hallucinations in Large Language Models

从证明到程序:刻画大语言模型中的工具诱导推理幻觉

Farima Fatahi Bayat, Pouya Pezeshkpour, Estevam Hruschka

机构 * Megagon Labs(Megagon实验室)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

AI总结 研究探讨了工具增强语言模型在使用外部工具时产生的推理幻觉问题,通过PYMATH基准测试发现,尽管工具使用提升了最终答案准确率,但推理过程却愈发不连贯,提出基于偏好优化的框架以改善工具使用下的推理深度。

Comments 19 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19742 2026-04-22 cs.SE 50%

PlayCoder: Making LLM-Generated GUI Code Playable

PlayCoder: 使LLM生成的GUI代码可播放

Zhiyuan Peng, Wei Tao, Xin Yin, Chenhao Ying, Yuan Luo, Yiwen Guo

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出PlayCoder框架,通过生成、评估和迭代修复GUI代码,提升代码的逻辑正确性和语义对齐,实现功能正确性和交互逻辑的改进。

Comments September 11, 2025 Submitted to FSE2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19425 2026-04-22 cs.HC 50%

seneca: A Personalized Conversational Planner

seneca:一个个性化的对话规划器

Simon Bohnen, Gabriel Garbers, Lukas Ellinger, Georg Groh

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出seneca,一种结合对话代理、持久数据库和处理器的个性化AI规划框架,旨在解决现有工具在持续自我调节、优先级设定和反思方面的不足。

Comments accepted to the CHI '26 Workshop on Tools for Thought

详情

展开后加载摘要…

URL PDF HTML 收藏