arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Carnegie Mellon University(卡内基梅隆大学)

共收录 2336
2608.13212 2026-08-14 cs.LG cs.SI 新提交

TANGCO: Learning Topology-Aware Capacity Allocation for Overload-driven Cascading Failures

TANGCO:学习应对过载驱动级联故障的拓扑感知容量分配

Orkun Irsoy, Leman Akoglu, Osman Yagan

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 TANGCO是一种拓扑感知神经图引导的容量优化模型,可应对过载驱动的级联故障,在人工与真实网络上均优于手动启发式方法,具备良好迁移性,部署成本低且训练效率高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12629 2026-08-14 cs.LG 新提交

CAKE: Compiler-Agent Co-Design for Frontier Kernel Evolution

CAKE:面向前沿核函数演进的编译器-智能体协同设计

Zihao Ye, Yingyi Huang, Hongyi Jin, Bohan Hou, Junru Shao, Zhongming Yu, Jinqi Chen, Meghan Cowan, Shiyi Cao, Shanli Xing, Hanfeng Chen, Vinod Grover, Tianqi Chen, Luis Ceze

机构 * Carnegie Mellon University(卡内基梅隆大学) NVIDIA(英伟达公司)

AI总结 本文提出CAKE编译器-智能体协同设计方案,通过硬件显式IR实现GPU核函数演进,在Flash-KMeans等基准测试中性能优于CUDA/PTX,相关成果已提交上游PR。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12321 2026-08-14 cs.CL cs.AI 新提交

LLMs Know the Constraint But Do Not Use It: Activation Bottlenecks in Pragmatic Constraint Reasoning

大型语言模型(LLMs)知道约束但不使用它:语用约束推理中的激活瓶颈

Yubo Li, Ramayya Krishnan, Rema Padman

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 该研究揭示LLMs虽编码了语用约束知识,但存在激活传递瓶颈,导致约束推理失败,激活修补可部分修复,且缓解干预未解决该传递问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11143 2026-08-14 cs.RO 版本更新

APEX: Learning Adaptive High-Platform Traversal for Humanoid Robots

APEX: 为双足机器人学习适应性高平台穿越

Yikai Wang, Tingxuan Leng, Changyi Lin, Shiqi Liu, Shir Simon, Bingqing Chen, Jonathan Francis, Ding Zhao

机构 * Carnegie Mellon University(卡内基梅隆大学) Bosch Center for Artificial Intelligence(博世人工智能中心)

AI总结 APEX通过感知和攀爬行为实现双足机器人高平台穿越,结合地形适应和安全正则化,实现高效探索与稳健适应。

Comments Project Website: https://apex-humanoid.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15076 2026-08-14 cs.LG cs.DM cs.DS 版本更新

Online Correlation Clustering: Simultaneously Optimizing All $\ell_p$-norms

Sami Davies, Benjamin Moseley, Heather Newman

机构 * Department of EECS at UC Berkeley(伯克利大学电子工程与计算机科学系) RelationalAI Tepper School of Business, Carnegie Mellon University(卡内基梅隆大学泰珀商学院) Carnegie Mellon University(卡内基梅隆大学) Department of Computer Science, Vassar College(瓦萨学院计算机科学系)

Comments 67 pages, appeared in ICALP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12269 2026-08-13 cs.CL 新提交

A Cascaded Unsupervised-Supervised NLP Pipeline for Detecting Accusatory Language in Public Procurement

一种用于检测公共采购中指控性语言的级联无监督-监督NLP流水线

Bryan Torres, Daniel Riofrío, José Vega-Sánchez, Nathaly Orozco, Carla Parra, Karen Rosero, Felipe Grijalva

机构 * Universidad San Francisco de Quito(基多圣弗朗西斯科大学) Universidad de Las Américas(美洲大学) Escuela Politécnica Nacional(国家理工学院) Carnegie Mellon University(卡内基梅隆大学)

AI总结 该研究针对公共采购中指控性语言检测问题,提出级联无监督-监督NLP流水线,结合Word2Vec、GMM和随机森林模型,可在类别不平衡下高效识别违规风险,提升采购透明度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11528 2026-08-13 cs.CL 新提交

Group Alignment-Induced Sycophancy: A Two-Sided Evaluation of Steerable Pluralistic Alignment

群体对齐诱导的谄媚性:可引导的多元对齐的双向评估

Haokai Zhao, Yunze Xiao, Weihao Xuan, Flora Salim, Benjamin Tag, Aditya Joshi

机构 * University of New South Wales(新南威尔士大学) Carnegie Mellon University(卡内基梅隆大学) University of Tokyo(东京大学)

AI总结 该研究提出GAS指标,评估3种方法、4个模型在13个人口统计群体上的对齐效果,发现群体对齐的观点收益和谄媚性变化存在群体异质性,建议采用双向多维度报告方式。

Comments 9 pages main text, 23 pages in total, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11519 2026-08-13 cs.LG 新提交

FLARE++: Low-rank attention with dynamic attention routing

FLARE++:带动态注意力路由的低秩注意力机制

Vedant Puri, Yongjie Jessica Zhang, Levent Burak Kara

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 FLARE++是带动态注意力路由的低秩注意力架构,通过复用FLARE编码器生成输入条件查询,保留低秩分解与线性复杂度,在PDE代理基准平均提升24%,Long Range Arena平均准确率提升2.3点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11390 2026-08-13 cs.LG 新提交

Mechanism Design for Generative Engines: From Exploitation toward Win-Win Outcomes

生成式引擎的机制设计:从利用到双赢结果

Chen Xu, Zitian Guo, Chenyan Xiong

机构 * Carnegie Mellon University(卡内基梅隆大学) University of California, San Diego(加利福尼亚大学圣迭戈分校)

AI总结 针对生成式引擎引用竞争引发的引用战争问题,本文将供给方与平台互动建模为重复斯塔克尔伯格博弈,提出VCR机制,实验显示其防御效用优于基线且能实现双赢。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11363 2026-08-13 cs.RO cs.LG 新提交

Adaptation of Generalist Robot Policies with Minimal Data

基于最少数据的通用机器人策略适配

Shreyas Kowshik, Sreyas Venkataraman, Leo Wang, Niharika Pant, Max Simchowitz, Aviral Kumar

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出MiDAS算法,结合离线行为克隆与在线强化学习,实现机器人策略仅用1次演示即可完成任务适配,性能优于基线且能泛化,为机器人自主学习提供可行方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12406 2026-08-13 cs.RO cs.AI cs.LG cs.SY eess.SY 版本更新

FACTR 2: Learning External Force Sensing for Commodity Robot Arms Improves Policy Learning

FACTR 2: 学习商用机器人手臂的外部力感知提升策略学习

Steven Oh, Jason Jingzhou Liu, Tony Tao, Philip Han, Kenneth Shaw, Satoshi Funabashi, Ruslan Salakhutdinov, Deepak Pathak

机构 * Carnegie Mellon University(卡内基梅隆大学) Waseda University(早稻田大学)

AI总结 提出无需专用力传感器的数据驱动方法NEXT,可在1分钟内从10分钟自由运动数据中训练,实现与专用关节力矩传感器相当的估计,并结合FIRST采样策略提升策略学习性能。

Comments Website at https://jasonjzliu.com/factr2

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22753 2026-08-13 cs.LG 版本更新

Spend Less, Fit Better: Budget-Efficient Scaling Law Fitting via Active Experiment Selection

少花钱,多适配:通过主动实验选择实现预算高效的缩放定律拟合

Sijie Li, Shanda Li, Haowei Lin, Weiwei Sun, Ameet Talwalkar, Yiming Yang

机构 * Peking University(北京大学) Carnegie Mellon University(卡内基梅隆大学) Datadog

AI总结 本文提出一种预算感知的序列实验设计方法,通过主动选择实验来提高缩放定律拟合的准确性,实验结果显示其在多种缩放定律任务中优于传统方法,仅用10%的预算即可达到全集拟合效果。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10484 2026-08-12 cs.RO cs.AI cs.CL 新提交

Lost in Reconstruction: Aligning Action Representations with Language in Vision-Language-Action Models

在重建中迷失:将视觉-语言-动作模型中的动作表示与语言对齐

Li Wenjie, Yash Jangir, Ignacy Stepka, Yash Agarwal, Marion Kipsang, Yonatan Bisk

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 该研究针对视觉-语言-动作模型中动作表示与语言脱节的问题,提出SALT语义对齐动作标记器,在SimplerEnv中使策略平均成功率达71.9%,显著优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10471 2026-08-12 cs.AI 新提交

RLMOpt: Adaptive Prompt Optimization via Recursive Language Models

RLMOpt:基于递归语言模型的自适应提示优化器

Subhash Bangalore Satheesha, Nirvik Pande, Deepthi Duddempudi, Bharath Dandala

机构 * Autonomize AI Carnegie Mellon University(卡内基梅隆大学)

AI总结 本研究提出基于递归语言模型(RLM)的自适应提示优化器RLMOpt,在四个基准上相比GEPA表现更优,效率更高且提示更小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10420 2026-08-12 cs.AI 新提交

Reasoning Shortcuts and Value Symmetries: What Symmetry Permits, Architecture Realizes, and Optimization Selects

推理捷径与价值对称性:对称性允许什么、架构实现什么以及优化选择什么

Xin Xu

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Pennsylvania(宾夕法尼亚大学)

AI总结 该研究分析神经符号系统的推理捷径,发现现有框架的关键定义不适用于其评估的基准,重新测量揭示无法解释的对比例与可证明结构相关,还明确了对称性惰性、自同构存在性等问题的计算复杂度,区分了对称性允许与优化选择的内容。

Comments 55 pages, 2 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10333 2026-08-12 cs.LG 新提交

MERA: Model Evolution and Routing with Skill Adaptation for Agentic Systems at Scale

MERA:面向大规模智能体系统的技能适配型模型演化与路由

Yuhang Yao, Zeyu Wang, Wanyi Chen, Tongyun Yang, Yuhang Han, Jie Xiao, Chengke Bao, Tianyi Zhao, Lynn Ai, Eric Yang, Tianyu Shi

机构 * Gradient Soochow University(苏州大学) Carnegie Mellon University(卡内基梅隆大学) Shanghai Jiao Tong University(上海交通大学) University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

AI总结 MERA以单模型调用为适应单元,通过多轮适配提升小模型能力,结合带验证器回退的成本校准路由,在HumanEval+MBPP、TAU-2等数据集上实现小模型性能提升与成本降低。

Comments Preliminary version in CAIS RL-Eval

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10296 2026-08-12 cs.CL 新提交

Cracks in the Foundation: Seemingly Minor Architectural Choices Impact Long Context Extension

基础的裂痕:看似微小的架构选择会影响长上下文扩展

Amanda Bertsch, Luca Soldaini, Matthew R. Gormley, Graham Neubig, Hannaneh Hajishirzi, Kyle Lo, Dirk Groeneveld

机构 * Ai2 Carnegie Mellon University(卡内基梅隆大学) University of Washington(华盛顿大学)

AI总结 该研究发现,Olmo、Llama、Qwen等稠密模型系列的四个微小架构决策会复合降低长上下文性能,结合三个及以上选择可使性能降47%,经17万余GPU小时训练发布OlmPool,其部分模型长上下文性能优于Llama 3。

Comments 29 pages; accepted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10289 2026-08-12 cs.CV cs.LG 新提交

SeFaR: Semantic Feature-aware Robustness Testing of Deep Neural Networks

SeFaR:面向深度神经网络的语义特征感知鲁棒性测试

Nusrat Jahan Mozumder, Divya Gopinath, Corina Pasareanu, Matthew Dwyer

机构 * University of Virginia(弗吉尼亚大学) KBR Inc.(KBR公司) NASA Ames(美国国家航空航天局艾姆斯研究中心) Carnegie Mellon University(卡内基梅隆大学)

AI总结 SeFaR是一个以语义特征为核心的视觉模型鲁棒性测试框架,可在保留需求满足性的前提下,生成测试输入以识别影响模型决策的特征,进而发现故障并关联相关特征。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16057 2026-08-12 cs.CL cs.AI 版本更新

Frontier AI performance across the business disciplines: a case-grounded benchmark of knowledge work and analytical reasoning

跨商业学科的前沿人工智能性能:基于案例的知识工作和分析推理基准

Ajay Patel, Kartik Hosanagar, Ramayya Krishnan, Chris Callison-Burch, Karim Lakhani

机构 * The Wharton School, University of Pennsylvania(宾夕法尼亚大学沃顿商学院) Carnegie Mellon University(卡内基梅隆大学) Harvard Business School, Harvard University(哈佛大学哈佛商学院)

AI总结 研究针对人工智能在白领分析性知识工作衡量上的差距,利用顶尖商学院案例教学法构建BusinessCaseBench基准,发现前沿AI模型在此基准上得分高且能力提升快,为商学院及相关职业角色带来启示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23146 2026-08-12 cs.LG cs.AI 版本更新

Infra-Bayesian Reinforcement Learning Agents Outperform Classical RL For Worst-Case Robustness

Infra-Bayesian 强化学习智能体在最坏情况鲁棒性上优于经典强化学习

Manish Aryal, Faiyaz Azam, Agnivo Banerjee, Syed Mahir Ahamed, Sai Sidhanth Manoharan Jayanthi, Allegra Laro, Clément Legentilhomme, Andrew Lin, Florian Lorkowski, Marina Pérez del Valle, Radman Rakhshandehroo, Patric Rommel, Emanuel Ruzak, Nathan Theng, Paul Yushin Rapoport

机构 * Purdue University(普渡大学) Carnegie Mellon University(卡内基梅隆大学) WorldQuant University(WorldQuant大学) UC Berkeley(加州大学伯克利分校) Aix-Marseille University(阿维尼翁-马赛大学) MIT(麻省理工学院) University of Zurich(苏黎世大学) University of British Columbia(不列颠哥伦比亚大学) University of Stuttgart(斯图加特大学) University of Buenos Aires(布宜诺斯艾利斯大学) California State University, Fresno(弗雷斯诺加州州立大学) University of Chicago(芝加哥大学)

AI总结 针对经典强化学习在模型误设和策略依赖不确定性下的失败,提出 Infra-Bayesian 框架,通过区分概率不确定性和 Knightian 不确定性并采用最坏情况决策,在有限状态无状态决策问题中实现更低的最坏情况遗憾。

Comments RLC 2026: Accepted to Finding the Frame Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02319 2026-08-12 cs.CL 版本更新

No Single Best Model for Diversity: Learning a Router for Sample Diversity

没有单一最佳模型用于多样性:学习一个路由器以实现样本多样性

Yuhan Liu, Fangyuan Xu, Vishakh Padmakumar, Daphne Ippolito, Eunsol Choi

机构 * New York University(纽约大学) Stanford University(斯坦福大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文研究了如何通过路由器选择最佳模型以生成多样化的响应,发现无单一模型在广泛提示下表现最佳,且在不同数据集上具有泛化能力。

Comments Accepted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20907 2026-08-12 cs.CL 版本更新

The Hidden Puppet Master: Predicting Human Belief Change in Manipulative LLM Dialogues

隐藏的提线人:预测操纵性大语言模型对话中的人类信念变化

Jocelyn Shen, Amina Luvsanchultem, Jessica Kim, Kynnedy Smith, Valdemar Danry, Kantwon Rogers, Hae Won Park, Maarten Sap, Cynthia Breazeal

机构 * Massachusetts Institute of Technology(麻省理工学院) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出PUPPET框架,通过分析1035个人类与LLM交互数据,揭示当前安全范式在检测操纵策略与信念变化幅度之间的关键断层,证明先进LLM对人类信念易感性的系统低估。

Comments Accepted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09857 2026-08-11 cs.RO cs.AI 新提交

Agentic Harnesses: LLM-Driven Verification Layers for Robot Autonomy

智能体 harness:面向机器人自主的大语言模型驱动验证层

Rohan Bhagra, Mahantesh Halapannavar, Uddhav Bhattarai

机构 * Carnegie Mellon University(卡内基梅隆大学) Pacific Northwest National Laboratory(太平洋西北国家实验室)

AI总结 针对机器人规划模型的安全与伦理风险,提出LLM驱动的验证层作为中间件管控计划,实现近85%的类别准确率、97%的对抗性攻击遏制率,为机器人自主提供可靠保障。

Comments 7 pages. Not yet finalized for conference submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09162 2026-08-11 cs.LG cs.AI 新提交

Tabular Numeric Stretch Transformation

表格数值拉伸变换

Zihao Ye, Juyong Kim, Johnna Sundberg, Burak Varici, Pradeep Ravikumar

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 针对表格数值特征变换研究不足的问题,提出含无监督与有监督变体的拉伸变换框架,经38个数据集实验,其有监督变体性能优于所有基线,为表格深度学习提供新策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09146 2026-08-11 cs.CV 新提交

Multi-Submap Implicit Neural SLAM with Local-to-Global Loop Closure for Large-Scale Scene Reconstruction

面向大规模场景重建的结合局部到全局回环检测的多子图隐式神经SLAM

Tianchen Deng, Chongdi Wang, Nailin Wang, Lei Zhao, Ziqi Ma, Tianjun Zhang, Zhe Liu, Danwei Wang, Hesheng Wang

机构 * School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学自动化与智能感知学院) Carnegie Mellon University(卡内基梅隆大学) School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电气与电子工程学院)

AI总结 本文提出一种带多子图架构与双层回环检测机制的神经SLAM系统,结合渐进式建图、光流跟踪、局部到全局回环及子图间在线蒸馏算法,在大规模场景重建性能上优于现有最优方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09127 2026-08-11 cs.RO cs.GR 新提交

High Fidelity Capture, Reconstruction, and Transfer of Human Demonstrations for Robot-Assisted Bathing

面向机器人辅助洗澡任务的人类演示的高保真捕捉、重建与迁移

Arjun S. Lakshmipathy, Jonathan P. King, Ethan Zuo, Rohit Satishkumar, Hongyi Chen, Jeffrey Ichnowski, Dan Ding, Zackory Erickson, Nancy S. Pollard

机构 * School of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机科学学院) School of Health and Rehabilitation Sciences, University of Pittsburgh(匹兹堡大学健康与康复科学学院)

AI总结 针对机器人辅助洗澡任务中人类演示难以迁移的问题,提出以接触区域为核心的高保真处理框架,构建含多维度同步数据的数据集,实现灵巧软手完成洗澡任务,相关材料将公开以推动pHRI研究。

Comments Accepted to Robotics: Science and Systems (RSS) 2026. Official conference page: https://www.roboticsproceedings.org/rss22/p094.pdf

Journal ref Proceedings of Robotics: Science and Systems (RSS), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09031 2026-08-11 cs.LG 新提交

HOPPER: Learnable Hop Extraction for Linearized Graph Sequence Models

HOPPER:用于线性化图序列模型的可学习跳提取方法

Isuru Herath, Arin Gopakumar, Sharan Sahu

机构 * Carnegie Mellon University(卡内基梅隆大学) UC Berkeley(加州大学伯克利分校) Cornell University(康奈尔大学)

AI总结 HOPPER是LGSM的可学习扩展,可提取跳序列以实现自适应图传播,在ECHO-Synth基准表现最优或具竞争力,调整结构记忆窗口可优化LRIM基准准确率,为长距离图表示学习提供灵活方法。

Comments 24 pages, 1 figure, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08896 2026-08-11 cs.AI 新提交

From Manuals to Maintenance: Fine-Tuning MedGemma for Multi-Modal Imaging System Support in Low-Resource Settings

从手册到维护:在低资源场景中微调MedGemma以提供多模态成像系统支持

Bernes Lorier Atabonfack, Zion Kongbi Nfo, Ahmed Tahiru Issah, Tolulope Olusuyi, Clemence Ingabire, Mohammed Hardi Abdul Baaki, Mawuli Deku, Abdulrazaq Zubair, Alyasaa Anas, Raymond Confidence, Maruf Adewole, Udunna C. Anazodo

机构 * Carnegie Mellon University Africa(非洲卡内基梅隆大学) IngenziAI(因根齐人工智能公司) Federal University of Health Sciences Azare(阿扎雷联邦健康科学大学) University of Maiduguri Teaching Hospital(迈杜古里大学教学医院) Lawson Health Research Institute(劳森健康研究所) University of Pennsylvania(宾夕法尼亚大学) McGill University(麦吉尔大学)

AI总结 针对中低收入国家医疗设备维护难题,研究人员构建INGENZI_DatasetV1数据集,用QLoRA微调MedGemma-4b-it模型,使维修问答指标大幅提升,为低资源场景AI辅助医疗维护奠定基础。

Comments Accepted at the AFRICAI 2026 Workshop, a satellite event at MICCAI 2026. To appear in Springer Lecture Notes in Computer Science (LNCS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08566 2026-08-11 cs.CV cs.AI 新提交

On-Device Multi-Species Malaria Detection with Uncertainty-Calibrated Slide-Level Aggregation

基于不确定性校准的玻片级聚合的设备端多物种疟疾检测

Idaya Seidu, Ahmed Tahiru Issah, Charles B. Delahunt, Carine Mukamakuza

机构 * Carnegie Mellon University Africa(卡内基梅隆大学非洲分校) University of Washington(华盛顿大学)

AI总结 针对资源有限地区疟疾检测的临床约束,开发基于YOLOv13n的设备端多物种疟疾检测系统,满足多物种鉴别等要求,在2739张图像上实现较高检测精度与聚合性能。

Comments Accepted at The Fifth Workshop on Applications of Medical AI (AMAI) 2026, a satellite event at MICCAI 2026. To appear in Springer Lecture Notes in Computer Science (LNCS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08284 2026-08-11 cs.AI 新提交

Fair on the Surface? Benchmarking Hidden-Output Fairness Gaps in LLM Recommenders

表面上公平?对LLM推荐器的隐藏输出公平性差距进行基准测试

Chan Aristella Lu, Arya Fayyazi, Junhao Zhang, Saeid Shokoufa, Yue Xing, Zhen Xiang, Kyu Hyung Lee, Mehdi Kamal, Massoud Pedram

机构 * University of Georgia(佐治亚大学) University of Southern California(南加州大学) Carnegie Mellon University(卡内基梅隆大学) Michigan State University(密歇根州立大学)

AI总结 该研究提出首个联合评估LLM推荐器可观测输出与隐藏表示公平性的基准FairGap,发现二者存在根本张力,现有框架无法诊断。

详情

展开后加载摘要…

URL PDF HTML 收藏