arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Southern California(南加州大学)

2026-06-30 至 2026-06-30 共收录 10
2606.29784 2026-06-30 stat.ME cs.AI econ.EM

HERO: Improving the Reliability and Sensitivity of Generative Model Evaluation Using Historical Data

HERO: 利用历史数据提升生成模型评估的可靠性与敏感性

Xinrui Ruan, Zhenyu Zhao, Waverly Wei, Yueshan Zhang, Zeyu Zheng, Sui Huang, Jingshen Wang

机构 * Division of Biostatistics, University of California, Berkeley(加州大学伯克利分校生物统计学系) Roblox Corporation(Roblox公司) Department of Data Sciences and Operations, University of Southern California(南加州大学数据科学与运营系) School of Mathematical Sciences, Nankai University(南开大学数学科学学院) Department of Industrial Engineering and Operations Research, University of California, Berkeley(加州大学伯克利分校工业工程与运筹学系)

AI总结 提出HERO框架,通过历史数据校准噪声标签并锚定协变量,降低模型评估的偏差和方差,提升可靠性与敏感性。

Comments 30 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29713 2026-06-30 cs.CL cs.AI cs.LG

SEVA: Self-Evolving Verification Agent with Process Reward for Fact Attribution

SEVA: 具有过程奖励的自进化验证代理用于事实归因

Aojie Yuan, Yi Nian, Haiyue Zhang, Zijian Su, Yue Zhao

机构 * University of Southern California, Los Angeles, USA(美国南加州大学,洛杉矶) University of Michigan, Ann Arbor, USA(美国密歇根大学,安娜堡)

AI总结 提出SEVA,一种结构化验证代理,通过过程奖励解决多组件输出中的优势崩溃问题,实现自我进化循环,在7B模型上验证了奖励粒度必须匹配输出粒度的原则。

Comments Accepted at AI4GOOD@ICML 2026 and FAGEN@ICML 2026. Code: https://github.com/Justin0504/Verifiable_agent

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29049 2026-06-30 cs.LG

MOSAIC: Orchestrating Collaborative Knowledge Tracing with Hierarchical Semantic Alignment

MOSAIC: 通过层次语义对齐编排协作知识追踪

Xinjin Li, Mengyue Wang, Yuzhen Lin, Pengbin Feng, Ziqi Sha, Yeyang Zhou, Yu Ma

机构 * Columbia University(哥伦比亚大学) University of California, Berkeley(加州大学伯克利分校) School of Information Systems and Management, Carnegie Mellon University(信息系统与管理学院,卡内基梅隆大学) Department of Mathematics, University of Southern California(数学系,南加州大学) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Computer Science Department, UC San Diego(计算机科学系,UCSD)

AI总结 提出MOSAIC框架,利用冻结LLM生成动态嵌入和层次预测提示,结合跨粒度一致性目标,在协作知识追踪中实现多粒度掌握估计,在多个数据集上取得SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28863 2026-06-30 cs.CY cs.AI

Defeat Devices in AI Systems

AI系统中的失效装置

Emilio Ferrara

机构 * Department of Computer Science(计算机科学系) University of Southern California(南加州大学)

AI总结 本文提出AI系统在评估与部署环境间行为差异的共性机制——失效装置,定义了三要素判别测试,并论证其可在前沿AI系统中自然涌现,需系统监测。

Comments Final version published in Future Internet, 18(7), 339, 2026

Journal ref Future Internet, 18(7), 339 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28739 2026-06-30 cs.AI

Agent Safety Is Action Alignment

智能体安全即行动对齐

Shawn Li, Yue Zhao

机构 * University of Southern California(南加州大学)

AI总结 本文指出将内容安全方法(如拒绝训练)直接应用于智能体场景存在根本性错误,提出智能体安全应通过最小权限原则在行动边界外部强制执行,并作为行动对齐(关系性、部署条件属性)来评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28390 2026-06-30 cs.CV cs.AI

Automated Quality Assessment of Geospatial Vector Data: A GeoAI Approach using Spatial Representation Learning

地理空间矢量数据自动化质量评估:基于空间表示学习的GeoAI方法

Hao Li, Chen Chu, Filip Biljecki, Cyrus Shahabi, Wenwen Li

机构 * Department of Geography, National University of Singapore, Singapore(新加坡国立大学地理系) University of Southern California(南加州大学) Department of Architecture, National University of Singapore, Singapore(新加坡国立大学建筑系) Department of Real Estate, National University of Singapore, Singapore(新加坡国立大学房地产系)

AI总结 提出Topo4Vec框架,通过拓扑错误模拟和空间表示学习,自动化评估地理空间矢量数据质量,在三个城市数据集上达到0.99的建筑物重叠检测准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09076 2026-06-30 cs.MA cs.AI cs.LG

Robust Multi-Agent LLMs under Byzantine Faults

在拜占庭故障下鲁棒的多智能体大语言模型

Haejoon Lee, Vincent-Daniel Yun, Dimitra Panagou, Sai Praneeth Karimireddy

机构 * Department of Robotics, University of Michigan, Ann Arbor, USA(密歇根大学机器人系,安娜堡,美国) Thomas Lord Department of Computer Science, University of Southern California, USA(南加州大学计算机科学托马斯·劳德系,美国)

AI总结 本文提出Self-Anchored Consensus算法,通过去中心化迭代过滤和优化协议提升多智能体系统在拜占庭故障下的鲁棒性,实验表明其在数学和常识推理任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05366 2026-06-30 cs.CL cs.AI cs.LG

Lost in Execution: On the Multilingual Robustness of Tool Calling in Large Language Models

在执行中迷失:大型语言模型在多语言环境下的工具调用鲁棒性研究

Zheng Luo, T Pranav Kutralingam, Ogochukwu N Okoani, Wanpeng Xu, Hua Wei, Xiyang Hu

机构 * University of Southern California(南加州大学) Arizona State University(亚利桑那州立大学)

AI总结 研究探讨了多语言环境下大型语言模型工具调用的鲁棒性,通过MLCL基准测试发现参数值语言不匹配是主要失败模式,尽管策略减少错误但无法恢复英语水平性能。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03546 2026-06-30 cs.CL cs.AI cs.HC cs.LG

Value-Action Alignment in Large Language Models under Privacy-Prosocial Conflict

大语言模型在隐私与亲社会冲突下的价值-行动对齐

Guanyu Chen, Chenxiao Yu, Xiyang Hu

机构 * Arizona State University(亚利桑那州立大学) University of Southern California(南加州大学)

AI总结 研究探讨大语言模型在隐私与亲社会冲突中的价值-行动对齐,通过多组结构方程模型分析隐私关注与亲社会性对数据共享的影响,提出价值-行动对齐率(VAAR)作为评估指标。

Comments Findings of the Association for Computational Linguistics: ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06732 2026-06-30 cs.CL cs.AI cs.IR

Are LLMs Reliable Rankers? Rank Manipulation via Two-Stage Token Optimization

LLMs的排名可靠性如何?通过两阶段令牌优化实现排名操纵

Tiancheng Xing, Jerry Li, Yixuan Du, Xiyang Hu

机构 * National University of Singapore(新加坡国立大学) University of Southern California(南加州大学) Georgetown University(乔治城大学) Arizona State University(亚利桑那州立大学)

AI总结 本文提出RAF方法,通过两阶段令牌优化生成自然语言提示,提升目标项在LLM排名中的位置,同时保持语言自然性,实验显示其在提升排名和保持自然性方面比现有方法更鲁棒。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏