arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Columbia University(哥伦比亚大学)

共收录 1073
2409.08775 2026-06-30 cs.HC cs.AI

What Should We Engineer in Prompts? Training Humans in Requirement-Driven LLM Use

提示中应工程什么?基于需求驱动的LLM使用训练

Qianou Ma, Weirui Peng, Chenyang Yang, Hua Shen, Kenneth Koedinger, Tongshuang Wu

机构 * Carnegie Mellon University(卡内基梅隆大学) Columbia University(哥伦比亚大学) University of Washington(华盛顿大学)

AI总结 本文提出ROPE框架,通过评估和训练套件帮助用户生成清晰需求,提升LLM应用构建效果。

Comments 15 pages; TOCHI 2025

Journal ref TOCHI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27973 2026-06-29 cs.CL cs.AI 新提交

From Black-Box to Clinical Insight: A Multi-Stage Explainable Framework for Speech-Based Cognitive Impairment Detection

从黑盒到临床洞察:用于语音认知障碍检测的多阶段可解释框架

Yasaman Haghbin, Sina Rashidi, Ali Zolnour, Fatemeh Taherinezhad, Ali Fartoot, Hossein Azadmaleki, James M Noble, Maryam Dadkhah, Maryam Zolnoori

机构 * Independent Researcher(独立研究者) Columbia University(哥伦比亚大学) Chalmers University of Technology(查尔姆斯理工大学)

AI总结 提出多阶段可解释框架,结合SHAP、语言学特征和LLM推理,将黑盒Transformer预测转化为临床叙事,在NIA PREPARE基准上F1=72.11%,医生评估显示与患者认知特征高度一致,SUS评分82/100。

Comments Accepted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27380 2026-06-29 cs.CL 新提交

A Survey of Automated Presentation Coaching: Systems, Methods, and Open Challenges

自动演讲辅导系统综述:系统、方法与开放挑战

Wen Liang, Li Siyan, Zackary Rackauckas, Julia Hirschberg

机构 * Columbia University(哥伦比亚大学) Red Hat(红帽公司) RoleGaku

AI总结 本文综述自动演讲辅导系统,提出五维任务分类法,覆盖发音、韵律、节奏和内容忠实度,并分析TTS示例生成与诊断方法,指出语料稀缺、口音公平和低延迟诊断等挑战。

Comments accepted into the BEA 2026 workshop at ACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07716 2026-06-26 cs.LG 版本更新

Computationally-efficient Graph Modeling with Refined Graph Random Features

基于精细化图随机特征的高效图建模

Krzysztof Choromanski, Avinava Dubey, Arijit Sehanobish, Isaac Reid

机构 * Google DeepMind(谷歌DeepMind) Columbia University(哥伦比亚大学) Google Research(谷歌研究)

AI总结 提出精细化图随机特征(GRFs++),通过行走拼接技术解决传统GRFs难以建模远距离节点关系的问题,在保持无偏性的同时提高计算效率,并扩展了行走终止机制以提升图核近似精度。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23434 2026-06-25 cs.LG 版本更新

Onsager-Machlup Posterior Transport for Deep Gaussian Processes

深度高斯过程的Onsager-Machlup后验传输

Jian Xu, Delu Zeng, John Paisley, Qibin Zhao

机构 * RIKEN iTHEMS(日本理化学研究院iTHEMS研究中心) RIKEN AIP(日本理化学研究院AIP研究中心) South China University of Technology(华南理工大学) Columbia University(哥伦比亚大学)

AI总结 提出OM-Path方法,通过概率流ODE和Onsager-Machlup路径正则化将深度高斯过程推断转化为后验传输,在大型UCI数据集上优于现有变分推断方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24839 2026-06-24 cs.AI stat.AP 新提交

Grading the Grader: Lessons from Evaluating an Agentic Data Analysis System

给评分者打分:评估智能数据分析系统的经验教训

Tian Zheng, Kai-Tai Hsu

机构 * Columbia University(哥伦比亚大学)

AI总结 针对智能数据分析系统输出复杂、难以评估的问题,提出三层人机评分级联(严格正则匹配、LLM宽松评分、基于片段的人工检查),在153个任务上实现100%精确率,宽松评分召回率97%,并通过迭代提示机制将评分成功率从36%提升至97%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24516 2026-06-24 cs.CV 新提交

What Do Flow-Based Inverse Solvers Approximate? A Posterior-Transport View

基于流的逆求解器近似了什么?一种后验传输视角

Jian Xu, Delu Zeng, John Paisley, Qibin Zhao

机构 * RIKEN iTHEMS(日本理化学研究所跨学科理论数学科学项目) RIKEN AIP(日本理化学研究所人工智能项目) South China University of Technology(华南理工大学) Columbia University(哥伦比亚大学)

AI总结 本文从后验传输角度分析基于流的逆问题求解器,证明源分布重加权可精确采样后验,而轨迹引导方法存在偏差,并提出一种高效的修正求解器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24256 2026-06-24 cs.CV 新提交

Trimming the Long-Tail of Visual World Modeling Evaluation

修剪视觉世界建模评估的长尾

Bingxuan Li, Yining Hong, Cheng Qian, Hyeonjeong Ha, Jiateng Liu, Zhenhailong Wang, Yue Guo, Yunzhu Li, Heng Ji

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Stanford University(斯坦福大学) Columbia University(哥伦比亚大学)

AI总结 针对视觉世界模型在罕见物理交互上泛化不足的问题,提出Tailor-Bench基准,通过常规、非常规和不可能三种场景模式系统评估模型推理能力,揭示长尾性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24160 2026-06-24 cs.AI 新提交

An Introduction to Causal Reinforcement Learning

因果强化学习导论

Elias Bareinboim, Junzhe Zhang, Sanghack Lee

机构 * Columbia University(哥伦比亚大学) Graduate School of Data Science(数据科学研究生院)

AI总结 本文提出将因果推断与强化学习统一在结构因果模型框架下,引入广义策略学习、模仿学习和反事实学习等新任务,形成因果强化学习(CRL)领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23913 2026-06-24 cs.LG 新提交

Closing the Loop: Formally Verified Law as a Reward Signal for Self-Improving Legal AI

闭环:形式化验证的法律作为自我改进法律AI的奖励信号

Armin Heydari, Torben Leowald

机构 * Harvard University(哈佛大学) Columbia University(哥伦比亚大学)

AI总结 提出一种架构,通过LLM驱动的形式化转换和验证内核,为法律AI提供可验证的奖励信号,实现闭环强化学习,并在多个法律领域展示其优势。

Comments 14 pages, no figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22775 2026-06-24 stat.ME cs.LG 新提交

Target-Aware Linear Regression Under Distribution Shift

分布漂移下的目标感知线性回归

Zhewen Hou, Tian Zheng

机构 * Department of Statistics(统计学系) Columbia University(哥伦比亚大学)

AI总结 针对训练与部署间的分布漂移,提出混合损失估计器作为目标感知基准,并开发了约束矩匹配和两阶段估计两种计算可行方案,推导渐近均方误差并比较性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21894 2026-06-24 cs.SE cs.AI 新提交

Skills for the future software profession: beyond agentic AI!

未来软件职业的技能:超越智能体AI!

Sungmin Kang, Baishakhi Ray, Abhik Roychoudhury

机构 * National University of Singapore(新加坡国立大学) Columbia University(哥伦比亚大学)

AI总结 本文通过2026年在纽约和新加坡举行的两场圆桌会议,总结未来软件工程师所需的核心技能,强调验证与确认在智能体处理实现时的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19416 2026-06-24 cs.LG 新提交

MortarBench: Evaluating Mortgage Loan Origination Agents

MortarBench: 评估抵押贷款发起代理

Matthew Toles, Yunan Lu, Manav Munjal, Bojun Liu, Yuanhao Deng, Stephanie Selig, Derek Rindner, Cheng Li, Zhou Yu

机构 * Columbia University(哥伦比亚大学) Tidalwave

AI总结 提出MortarBench基准,通过金融数据合成与变异管道生成覆盖边缘案例的示例,评估大语言模型在贷款发起任务中的表现,发现模型准确率低且存在偏见,并引入CRIT校准框架提升准确率至80.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00069 2026-06-24 cs.CY cs.AI cs.CL 版本更新

Societal Alignment Frameworks Can Improve LLM Alignment

社会对齐框架可以改进大语言模型对齐

Karolina Stańczak, Nicholas Meade, Mehar Bhatia, Hattie Zhou, Konstantin Böttinger, Jeremy Barnes, Jason Stanley, Jessica Montgomery, Richard Zemel, Nicolas Papernot, Nicolas Chapados, Denis Therien, Timothy P. Lillicrap, Ana Marasović, Sylvie Delacroix, Gillian K. Hadfield, Siva Reddy

机构 * ETH Zurich(苏黎世联邦理工学院) Mila, McGill University(麦吉尔大学米尔人工智能实验室) University of Cambridge(剑桥大学) Columbia University(哥伦比亚大学) University of Toronto, Google DeepMind(多伦多大学与DeepMind) McGill University, ServiceNow(麦吉尔大学与ServiceNow) Google DeepMind(谷歌DeepMind) University of Utah(犹他大学) King's College London(伦敦国王学院) Johns Hopkins University(约翰霍普金斯大学) Mila, McGill University, ServiceNow(麦吉尔大学米尔人工智能实验室与ServiceNow)

AI总结 本文提出借鉴社会、经济和契约对齐框架来改进大语言模型对齐,探讨不确定性在其中的作用,并将目标未指定性视为机遇而非缺陷,同时强调参与式对齐界面设计的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.07761 2026-06-24 cs.LG cs.AI stat.ML 版本更新

Impatient Bandits: Optimizing for the Long-Term Without Delay

不耐烦的赌博机:无需延迟地优化长期目标

Kelly W. Zhang, Thomas Baldwin-McDonald, Kamil Ciosek, Lucas Maystre, Daniel Russo

机构 * Imperial College London(帝国理工学院伦敦分校) University of Manchester(曼彻斯特大学) Spotify Reflection AI Columbia University(哥伦比亚大学)

AI总结 针对推荐系统中长期用户满意度优化问题,提出一种结合贝叶斯滤波的延迟奖励预测模型和赌博机算法,利用短期代理信号加速学习,理论证明遗憾界依赖于渐进反馈价值,在播客推荐A/B测试中显著优于基线方法。

Comments To appear in Journal of Machine Learning (JMLR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23277 2026-06-23 cs.AI 新提交

GIF: Locally Sound Geometric Information Flow Control for LLMs

GIF: 局部几何信息流控制用于大语言模型

Adam Storek, Nikolaus Holzer, Zhuo Zhang, Suman Jana

机构 * Columbia University(哥伦比亚大学)

AI总结 提出GIF框架,利用LLM雅可比矩阵和局部输出几何上界香农互信息,实现可扩展的信息流追踪,在提示注入和隐私泄露任务中达到近完美召回,且计算成本低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21836 2026-06-23 cs.AR cs.AI 新提交

AgentDSE: Reasoning-Augmented Architectural Design Space Exploration

AgentDSE:推理增强的架构设计空间探索

Chenyu Wang, Jiahe Caroline Shi, David Kong, Duane S. Boning, Zishen Wan, Yilun Du, Vijay Janapa Reddi

机构 * Harvard University(哈佛大学) Massachusetts Institute of Technology(麻省理工学院) Columbia University(哥伦比亚大学)

AI总结 提出AgentDSE,利用大语言模型编码代理自动进行架构推理,在DNN加速器映射、软硬件协同设计和CPU缓存层次优化中,以少两个数量级的评估次数达到竞争或更优的设计质量。

Comments Accepted to the Machine Learning for Architecture and Systems Workshop (MLArchSys), co-located with ISCA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21809 2026-06-23 cs.LG 新提交

Causal Gaussian Processes for Robust Treatment Effect Evaluation with Unobserved Confounding

因果高斯过程用于存在未观测混杂的鲁棒处理效应评估

Junzhe Zhang, Jingyuan Chen, Elias Bareinboim

机构 * Department of Electrical Engineering and Computer Science, Syracuse University(Syracuse大学电气工程与计算机科学系) Department of Computer Science, Columbia University(哥伦比亚大学计算机科学系)

AI总结 针对连续域上存在未观测混杂的因果效应评估问题,提出一种基于外生域离散化的因果高斯过程模型,可任意逼近任意因果模型的观测和干预分布。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21572 2026-06-23 cs.RO 新提交

Robot Critics that Sweat the Small Stuff

关注细节的机器人批评家

Sruthi Sudhakar, Junbang Liang, Sreehari Rammohan, Pavel Tokmakov, Richard Zemel, Carl Vondrick

机构 * Columbia University(哥伦比亚大学) Toyota Research Institute(丰田研究所)

AI总结 针对大视觉语言模型在机器人操作中难以区分微小视觉差异的问题,提出通过成功与失败轨迹构建成对进展监督来微调批评家,提升细粒度推理和失败检测能力,并在真实和仿真任务中分别提高策略成功率11%和5.9%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21256 2026-06-23 cs.LG 新提交

Intrinsic Flow Matching on Quantum Pure-State Manifolds with Phase-Aligned Transport

量子纯态流形上的内禀流匹配与相位对齐输运

Jian Xu, Delu Zeng, John Paisley, Qibin Zhao

机构 * RIKEN iTHEMS(日本理化学研究所跨学科理论与数学科学项目) RIKEN AIP(日本理化学研究所人工智能项目) South China University of Technology(华南理工大学) Columbia University(哥伦比亚大学)

AI总结 提出内禀流匹配(IFM)框架,在复射影空间上通过Pancharatnam相位对齐条件路径学习切向速度场,实现确定性输运,改善高维和相干敏感任务的生成建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20970 2026-06-23 cs.CV 新提交

CogniRoute: Learning to Route Social Evidence in Omni-Modal Models

CogniRoute: 在全模态模型中学习路由社会证据

Yifan Shen, Pei Tian, Xinzhuo Li, Bowen Fang, Shujun Xia, Bingxuan Li, Ana Jojic, Wenming Ye, Xu Cao, James Matthew Rehg, Ismini Lourentzou

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Columbia University(哥伦比亚大学) Google(谷歌)

AI总结 提出CogniRoute框架,通过模式引导的专家混合和路由感知强化学习,解决全模态模型在社会视频问答中证据选择不足的问题,在OmniSocialBench上准确率达59.38%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20891 2026-06-23 cs.CV cs.LG 新提交

Go-with-the-Track: Video Compositing and Motion Control with Point Tracking

Go-with-the-Track: 基于点追踪的视频合成与运动控制

Koichi Namekata, Yash Kant, Zhizheng Liu, Ryan D Burgert, Yuancheng Xu, Kuan Heng Lin, Emmett Steven, Julien Philip, Li Ma, Andrea Vedaldi, Paul Debevec, Ning Yu

机构 * Netflix USA(Netflix美国) Eyeline Labs USA(Eyeline Labs美国) University of Oxford(牛津大学) Eyeline Labs Los Angeles USA(Eyeline Labs洛杉矶美国) University of California, Los Angeles(加州大学洛杉矶分校) Stony Brook University USA(石溪大学美国) Columbia University USA(哥伦比亚大学美国) Eyeline Labs United Kingdom(Eyeline Labs英国) Netflix Los Angeles USA(Netflix洛杉矶美国)

AI总结 提出Go-with-the-Track,通过联合条件多参考图像和参考锚定点轨迹,统一视频合成与运动控制,实现精确合成与运动控制。

Comments SIGGRAPH 2026, Project page: https://eyeline-labs.github.io/Go-with-the-Track/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23443 2026-06-23 cs.LG cs.AI physics.chem-ph 新提交

What Does a Chemical Language Model Know About Molecules?

化学语言模型对分子了解多少?

Christian Kenneth, Etowah Adams, Liam Bai, Gerard JP van Westen

机构 * Department of Systems Biology, Columbia University(哥伦比亚大学系统生物学系) Computational Drug Discovery (CDD), Division of Medicinal Chemistry, Leiden University(莱顿大学药物化学系计算药物发现(CDD))

AI总结 通过稀疏自编码器分析MolFormer模型,发现早期层追踪位置以解析分子语法,后期层编码子结构及药理特征,非规范SMILES比无效SMILES引起更大表示偏移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20475 2026-06-23 cs.CV 版本更新

CREG: Compass Relational Evidence Graph for Characterizing Directional Structure in VLM Spatial-Reasoning Attribution

CREG: 用于表征VLM空间推理归因中方向性结构的指南针关系证据图

Kaizhen Tan, Yang Feng, Heqing Du

机构 * Carnegie Mellon University(卡内基梅隆大学) Columbia University(哥伦比亚大学)

AI总结 提出CREG框架,将令牌级归因转换为以参考为中心的指南针分布并测量方向对齐,揭示当前归因方法的方向性结构有限且常与图像布局混合,任务准确率提升不保证方向归因改善。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05098 2026-06-23 cs.CR cs.AI 版本更新

TIF: Learning Temporal Invariance in Android Malware Detectors

TIF:学习安卓恶意软件检测器的时间不变性

Xinran Zheng, Shuo Yang, Edith C. H. Ngai, Suman Jana, Lorenzo Cavallaro

机构 * University College London(伦敦大学学院) The University of Hong Kong(香港大学) Columbia University(哥伦比亚大学)

AI总结 针对恶意软件变种和新家族导致的分布漂移,提出时间不变训练框架TIF,通过多代理对比学习和不变梯度对齐学习稳定表征,提升检测器时间鲁棒性。

Comments Manuscript has been accepted by IEEE Transactions on Software Engineering (TSE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07397 2026-06-23 cs.LG 版本更新

Aligning AI-driven discovery with human intuition

使AI驱动的发现与人类直觉对齐

Kevin Zhang, Judah Goldfeder, Hod Lipson

机构 * Massachusetts Institute of Technology(麻省理工学院) Columbia University(哥伦比亚大学)

AI总结 针对AI发现的状态变量缺乏物理意义的问题,提出一种无需先验知识即可提取更符合人类直觉表示的新原则,并在多个系统上验证其与人类选择的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20183 2026-06-19 cs.LG 新提交

Effective Dimension Governs Generalization in Quantum Kernel Vision Models

有效维度主导量子核视觉模型的泛化

Jian Xu, Delu Zeng, John Paisley, Qibin Zhao

机构 * RIKEN iTHEMS(日本理化学研究院iTHEMS) RIKEN AIP(日本理化学研究院Advanced Institute for Photonics and Electronics) South China University of Technology(华南理工大学) Columbia University(哥伦比亚大学)

AI总结 通过有效维度d_eff解释量子视觉模型中纠缠结构增强泛化与量子噪声提升测试精度的现象,提出噪声形状核的谱分解与正则化机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19607 2026-06-19 cs.AI stat.AP 新提交

Which Pairs to Compare for LLM Post-Training?

LLM后训练中应比较哪些对?

Jiangze Han, Vineet Goyal, Will Ma

机构 * Columbia University(哥伦比亚大学)

AI总结 研究偏好后训练中如何选择最具信息量的比较对,提出基于采样设计的比较策展方法,通过DPO训练的理论分析给出优化准则,实验证明能提升样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19603 2026-06-19 cs.LG 新提交

Comparing Linear Probes with Mahalanobis Cosine Similarity

比较线性探针与马氏余弦相似度

Zhuofan Josh Ying, Peter Hase, Nikolaus Kriegeskorte

机构 * Columbia University(哥伦比亚大学) Stanford University(斯坦福大学) Schmidt Sciences(施密特科学)

AI总结 研究证明马氏余弦相似度与OOD AUROC存在线性关系,提供理论解释并验证其作为线性探针比较指标的有效性。

Comments 16 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19586 2026-06-19 cs.RO 新提交

One Demo is Worth a Thousand Trajectories: Action-View Augmentation for Visuomotor Policies

一个演示胜过千条轨迹:用于视觉运动策略的动作-视角增强

Chuer Pan, Litian Liang, Dominik Bauer, Eric Cousineau, Benjamin Burchfiel, Siyuan Feng, Shuran Song

机构 * Stanford University(斯坦福大学) Columbia University(哥伦比亚大学) Toyota Research Institute(丰田研究所)

AI总结 提出一种数据增强框架,通过高斯泼溅和轨迹优化生成逼真的鱼眼图像序列和物理可行的动作轨迹,提升操作策略在场景变化和障碍物下的成功率。

Comments Project website: https://chuerpan.com/1001-demos.github.io/. Published at CoRL 2025

Journal ref Proceedings of The 9th Conference on Robot Learning, PMLR 305:3902-3914, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏