arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Columbia University(哥伦比亚大学)

共收录 1073
2512.03262 2026-02-18 cs.SE cs.CL

Is Vibe Coding Safe? Benchmarking Vulnerability of Agent-Generated Code in Real-World Tasks

Vibe 编程是否安全?在现实任务中对代理生成代码的漏洞基准测试

Songwen Zhao, Danqing Wang, Kexun Zhang, Jiaxuan Luo, Zhuo Li, Lei Li

机构 * Carnegie Mellon University Language Technologies Institute(卡内基梅隆大学语言技术研究所) Columbia University(哥伦比亚大学) Johns Hopkins University(约翰霍普金斯大学) HydroX AI

AI总结 本文通过基准测试发现,Vibe 编程在现实任务中生成的代码安全性不足,尽管功能正确但存在安全漏洞,警示其在安全敏感领域应用的风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14509 2026-02-17 cs.CV

MacNet: An End-to-End Manifold-Constrained Adaptive Clustering Network for Interpretable Whole Slide Image Classification

MacNet: 一种端到端的流形约束自适应聚类网络用于可解释的整张滑动图像分类

Mingrui Ma, Chentao Li, Pan Huang, Jing Qin

机构 * School of Computer Science and Technology, Xinjiang University, Urumqi 830046, China, and the Affiliated Tumor Hospital of Xinjiang Medical University, Xinjiang 830011, China(新疆大学计算机科学与技术学院,中国新疆乌鲁木齐830046,以及新疆医科大学附属肿瘤医院,中国新疆830011) Fu Foundation School of Engineering and Applied Science, Columbia University, New York, NY 10027, USA(哥伦比亚大学福基金会工程与应用科学学院,美国纽约纽约州10027) School of Nursing, The Hong Kong Polytechnic University, Hong Kong 999077, SAR China(香港理工大学护理学院,中国香港999077,香港特别行政区)

AI总结 MacNet通过整合流形约束和自适应聚类,提升整张滑动图像分类的可解释性和性能。

Comments Our code is available at https://github.com/Prince-Lee-PathAI/MacNet

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14501 2026-02-17 cs.CV

Prototype Instance-semantic Disentanglement with Low-rank Regularized Subspace Clustering for WSIs Explainable Recognition

原型实例语义解耦与低秩正则化子空间聚类用于WSI可解释识别

Chentao Li, Pan Huang

机构 * Columbia University(哥伦比亚大学) Hong Kong Polytechnic University(香港理工大学)

AI总结 本文提出PID-LRSC框架,通过低秩正则化子空间聚类和增强对比学习解决WSI中实例与语义耦合问题,提升模型可解释性和诊断可靠性。

Comments Our code is available at https://github.com/Prince-Lee-PathAI/PID-LRSC

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13808 2026-02-17 cs.AI cs.SE

An end-to-end agentic pipeline for smart contract translation and quality evaluation

面向智能合约翻译和质量评估的端到端代理流程

Abhinav Goel, Chaitya Shah, Agostino Capponi, Alfio Gliozzo

机构 * Columbia University(哥伦比亚大学) IBM T.J. Watson Research Center(IBM T.J.沃森研究中心)

AI总结 本文提出端到端智能合约翻译与质量评估框架,通过代理团队实现结构化输出与多维度质量评估。

Comments 17 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00232 2026-02-17 cs.CL cs.AI cs.CY cs.LG

BiasFreeBench: a Benchmark for Mitigating Bias in Large Language Model Responses

BiasFreeBench: 一个用于减轻大型语言模型响应偏见的基准测试

Xin Xu, Xunzhi He, Churan Zhi, Ruizhe Chen, Julian McAuley, Zexue He

机构 * UC San Diego(加州大学圣地亚哥分校) Columbia University(哥伦比亚大学) Zhejiang University(浙江大学) Stanford University(斯坦福大学)

AI总结 BiasFreeBench通过统一测试平台评估八种主流偏见缓解方法,提供响应层面的偏见自由分数,旨在提升大型语言模型的公平性和安全性。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.11907 2026-02-17 cs.LG cs.SI

GraphFM: A generalist graph transformer that learns transferable representations across diverse domains

GraphFM: 一种通用的图变换器,能够在不同领域中学习可迁移的表示

Divyansha Lachi, Mehdi Azabou, Vinam Arora, Eva Dyer

机构 * University of Pennsylvania(宾夕法尼亚大学) Columbia University(哥伦比亚大学)

AI总结 GraphFM是一种通用图变换器,通过多图预训练学习可迁移的表示,提升跨不同图结构和任务的性能。

Journal ref Transactions on Machine Learning Research, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13543 2026-02-17 cs.IR cs.CL cs.LG

LiveNewsBench: Evaluating LLM Web Search Capabilities with Freshly Curated News

LiveNewsBench: 用最新整理的新闻评估大语言模型网络搜索能力

Yunfan Zhang, Kathleen McKeown, Smaranda Muresan

机构 * Columbia University(哥伦比亚大学) Barnard College(巴纳德学院)

AI总结 LiveNewsBench通过最新新闻数据评估大语言模型的网络搜索能力,提供多跳搜索和推理任务,支持大规模训练数据集构建,公开排行榜和代码。

Comments An earlier version of this work was publicly available on OpenReview as an ICLR 2026 submission in September 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15756 2026-02-17 cs.SE cs.AI

Automated Proof Generation for Rust Code via Self-Evolution

通过自我进化实现Rust代码的自动证明生成

Tianyu Chen, Shuai Lu, Shan Lu, Yeyun Gong, Chenyuan Yang, Xuheng Li, Md Rakib Hossain Misu, Hao Yu, Nan Duan, Peng Cheng, Fan Yang, Shuvendu K Lahiri, Tao Xie, Lidong Zhou

机构 * Peking University(北京大学) Microsoft Research(微软研究院) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Columbia University(哥伦比亚大学) University of California Irvine(加州大学 Irvine 分校)

AI总结 SAFE框架通过自我进化循环和自我调试机制,提升开源模型自动编写Rust代码证明的能力,准确率达52.52%

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.11797 2026-02-17 q-fin.PM cs.LG q-fin.CP

Data-Driven Merton's Strategies via Policy Randomization

基于策略随机化的数据驱动梅顿策略

Min Dai, Yuchao Dong, Yanwei Jia, Xun Yu Zhou

机构 * Department of Applied Mathematics and School of Accounting and Finance, The Hong Kong Polytechnic University(应用数学系和会计与金融学院,香港理工大学) Department of Systems Engineering and Engineering Management, The Chinese University of Hong Kong(系统工程与工程管理系,香港中文大学) Department of Industrial Engineering and Operations Research & Data Science Institute, Columbia University(工业工程与运筹学系及数据科学研究所,哥伦比亚大学)

AI总结 本文提出基于策略随机化的数据驱动方法,用于解决不完全市场中的梅顿期望效用最大化问题,通过强化学习算法实现优于传统方法的性能。

Comments 45 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13028 2026-02-16 cs.CV cs.CL

Human-Aligned MLLM Judges for Fine-Grained Image Editing Evaluation: A Benchmark, Framework, and Analysis

面向细粒度图像编辑评估的人类对齐MLLM评判:一个基准、框架和分析

Runzhou Liu, Hailey Weingord, Sejal Mittal, Prakhar Dungarwal, Anusha Nandula, Bo Ni, Samyadeep Basu, Hongjie Chen, Nesreen K. Ahmed, Li Li, Jiayi Zhang, Koustava Goswami, Subhojyoti Mukherjee, Branislav Kveton, Puneet Mathur, Franck Dernoncourt, Yue Zhao, Yu Wang, Ryan A. Rossi, Zhengzhong Tu, Hongru Du

机构 * University of Virginia(弗吉尼亚大学) Columbia University(哥伦比亚大学) Vanderbilt University(范德比大学) Adobe Research(Adobe研究) Dolby Laboratories(杜比实验室) Cisco Research(思科研究) University of Southern California(南加州大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) University of Oregon(俄勒冈大学) Texas A&M University(德克萨斯大学)

AI总结 本文提出细粒度MLLM评判框架,通过分解十二个可解释因素,提升图像编辑评估的精度与实用性,为研究和改进图像编辑方法提供实用基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04166 2026-02-16 cs.LG stat.CO stat.ML

N$^2$: A Unified Python Package and Test Bench for Nearest Neighbor-Based Matrix Completion

N²:一种统一的Python包和测试平台,用于基于最近邻的矩阵补全

Caleb Chin, Aashish Khubchandani, Harshvardhan Maskara, Kyuseong Choi, Jacob Feitelberg, Albert Gong, Manit Paul, Tathagata Sadhukhan, Anish Agarwal, Raaz Dwivedi

机构 * Cornell University(康奈尔大学) Columbia University(哥伦比亚大学) University of Pennsylvania(宾夕法尼亚大学)

AI总结 本文提出N²,一种统一的Python包和测试平台,用于基于最近邻的矩阵补全,展示了新的NN变体和现实世界数据集的基准测试,证明NN方法在现实应用中的优越性。

Comments 21 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12631 2026-02-16 cs.AI cs.HC cs.LG

AI Agents for Inventory Control: Human-LLM-OR Complementarity

面向库存控制的AI代理:人类-大语言模型-运筹学互补性

Jackie Baek, Yaopeng Fu, Will Ma, Tianyi Peng

机构 * Stern School of Business, New York University(纽约大学斯特恩商学院) Columbia University(哥伦比亚大学) Graduate School of Business and Data Science Institute, Columbia University(哥伦比亚大学商学院与数据科学研究院)

AI总结 本文研究了人类、大语言模型和运筹学算法在库存控制中的互补性,通过实验发现人机协作能提升利润,且大量个体从中受益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12112 2026-02-13 cs.LG

Few-Shot Design Optimization by Exploiting Auxiliary Information

通过利用辅助信息进行少样本设计优化

Arjun Mani, Carl Vondrick, Richard Zemel

机构 * Department of Computer Science, Columbia University, New York, New York, USA(计算机科学系,哥伦比亚大学)

AI总结 本文提出了一种利用辅助信息进行少样本设计优化的方法,通过神经模型预测未见过的设计,提升了设计任务的优化效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19078 2026-02-13 cs.LG

Diffusion Bridge Variational Inference for Deep Gaussian Processes

扩散桥变分推断用于深度高斯过程

Jian Xu, Qibin Zhao, John Paisley, Delu Zeng

机构 * RIKEN AIP Columbia University(哥伦比亚大学)

AI总结 本文提出DBVI,通过学习的数据依赖初始分布改进DDVI,提升大规模深度高斯过程的推断效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11242 2026-02-13 cs.CV

ReTracing: An Archaeological Approach Through Body, Machine, and Generative Systems

ReTracing:通过身体、机器和生成系统进行考古学研究

Yitong Wang, Yue Yao

机构 * Department of Machine Learning(机器学习系) Carnegie Mellon University(卡内基梅隆大学) SIPA Technology Policy and Innovation(技术政策与创新研究所) Columbia University(哥伦比亚大学)

AI总结 ReTracing通过AI、人类和机器人互动,探索生成系统如何通过编舞运动反映社会文化偏见。

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.06338 2026-02-13 stat.ML cs.LG

Minimax Optimal Estimation of Stability Under Distribution Shift

在分布偏移下稳定性最小最大最优估计

Hongseok Namkoong, Yuanzhe Ma, Peter W. Glynn

机构 * Decision, Risk, and Operations Division(决策、风险与运营部门) Department of Industrial Engineering and Operations Research(工业工程与运筹学系) Management Science and Engineering(管理科学与工程) Columbia University(哥伦比亚大学) Stanford University(斯坦福大学)

AI总结 本文提出了一种最小最大最优稳定性估计器,用于评估系统在分布偏移下的稳定性,通过分析收敛速率和实证验证,展示了其在鲁棒性问题中的应用价值。

Journal ref Operations Research 2026 74:1, 464-483

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10547 2026-02-12 cs.RO

ReSPEC: A Framework for Online Multispectral Sensor Reconfiguration in Dynamic Environments

ReSPEC:动态环境中在线多光谱传感器重新配置框架

Yanchen Liu, Yuang Fan, Minghui Zhao, Xiaofan Jiang

机构 * Department of Electrical Engineering, Columbia University(电气工程系,哥伦比亚大学)

AI总结 ReSPEC框架通过强化学习实现动态多光谱传感器重新配置,提升机器人在复杂环境下的感知效率与资源利用率。

Comments 8 pages, 4 figures. This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10469 2026-02-12 cs.GT cs.LG math.OC

Online Generalized-mean Welfare Maximization: Achieving Near-Optimal Regret from Samples

在线广义均值福利最大化:从样本中实现近最优的遗憾

Zongjun Yang, Rachitesh Kumar, Christian Kroer

机构 * Columbia University(哥伦比亚大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出了一种在线广义均值福利最大化算法,在无需分布知识的情况下实现近最优的遗憾率,通过重新求解范式应对非平稳性和分布偏移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10305 2026-02-12 cs.LG cs.AI cs.RO

Confounding Robust Continuous Control via Automatic Reward Shaping

通过自动奖励塑造实现鲁棒的连续控制

Mateo Juliani, Mingxuan Li, Elias Bareinboim

机构 * Columbia University(哥伦比亚大学)

AI总结 本文提出通过自动学习奖励塑造函数,从因果视角提升连续控制在未观察混淆变量下的鲁棒性。

Comments Mateo Juliani and Mingxuan Li contributed equally to this work; accepted in AAMAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02700 2026-02-12 eess.IV cs.CV eess.SP

A UAV-Based VNIR Hyperspectral Benchmark Dataset for Landmine and UXO Detection

基于无人机的VNIR超光谱基准数据集用于地雷和未爆炸物检测

Sagar Lekhak, Emmett J. Ientilucci, Jasper Baur, Susmita Ghosh

机构 * Rochester Institute of Technology, Chester F. Carlson Center for Imaging Science(罗切斯特理工学院,切斯特·F·卡尔森成像科学中心) Lamont Doherty Earth Observatory, Columbia University(拉蒙特-多赫蒂地球观测站,哥伦比亚大学) Demining Research Community(排雷研究社区)

AI总结 本文提出一个基于无人机的VNIR超光谱数据集,用于地雷和UXO检测,通过多传感器平台采集高保真光谱数据,支持可重复研究。

Comments This work was accepted and presented as an oral paper at the Indian Geoscience and Remote Sensing Symposium (InGARSS) 2025 and appears in the IEEE InGARSS 2025 Proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23270 2026-02-12 cs.RO cs.AI cs.LG

Localized Graph-Based Neural Dynamics Models for Terrain Manipulation

基于图的神经动力学模型用于地形操控

Chaoqi Liu, Yunzhu Li, Kris Hauser

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Columbia University(哥伦比亚大学)

AI总结 本文提出基于图的神经动力学模型,通过局部化粒子图实现高效地形操控,提升预测精度和计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10013 2026-02-11 cs.RO

Learning Force-Regulated Manipulation with a Low-Cost Tactile-Force-Controlled Gripper

通过低成本的触觉-力控夹具学习力调节的操控

Xuhui Kang, Tongxuan Tian, Sung-Wook Lee, Binghao Huang, Yunzhu Li, Yen-Ling Kuo

机构 * University of Virginia(弗吉尼亚大学) Columbia University(哥伦比亚大学)

AI总结 本文提出TF-Gripper和RETAF框架,通过低成本触觉-力控夹具和高频率力调节方法,提升机器人在日常力敏感物体上的操控精度与稳定性。

Comments 10 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03560 2026-02-11 math.OC cs.LG math.ST stat.ML stat.TH

Stochastic Optimization with Optimal Importance Sampling

具有最优重要性采样的随机优化

Liviu Aolaritei, Bart P. G. Van Parys, Henry Lam, Michael I. Jordan

机构 * University of California, Berkeley(加州大学伯克利分校) CWI(荷兰信息与计算科学研究所) Columbia University(哥伦比亚大学) Inria(法国国家信息与自动化技术研究院)

AI总结 本文提出了一种单循环随机逼近算法,用于解决随机优化中决策变量与重要性采样分布相互依赖的问题,实现了全局收敛和最小渐近方差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09196 2026-02-11 cs.LG stat.ML

Fair Feature Importance Scores via Feature Occlusion and Permutation

通过特征遮蔽和排列实现公平的特征重要性评分

Camille Little, Madeline Navarro, Santiago Segarra, Genevera Allen

机构 * Rice University(里士大学) Columbia University(哥伦比亚大学)

AI总结 本文提出两种模型无关方法,通过特征遮蔽和排列评估特征对公平性的贡献,为公平性评估提供新的可解释工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09040 2026-02-11 eess.AS cs.AI cs.LG cs.SD

Soft Clustering Anchors for Self-Supervised Speech Representation Learning in Joint Embedding Prediction Architectures

用于联合嵌入预测架构中自监督语音表示学习的软聚类锚点

Georgios Ioannides, Adrian Kieback, Judah Goldfeder, Linsey Pang, Aman Chadha, Aaron Elkins, Yann LeCun, Ravid Shwartz-Ziv

机构 * Carnegie Mellon University(卡内基梅隆大学) New York University(纽约大学) James Silberrad Brown Center for AI(詹姆斯·西伯拉德·布朗人工智能中心) Columbia University(哥伦比亚大学) Northeastern University(东北大学) Stanford University(斯坦福大学) Amazon GenAI(亚马逊生成人工智能)

AI总结 GMM-Anchored JEPA通过软聚类锚点提升语音表示学习,实现ASR、情感识别和槽填充的性能提升。

Comments 15 pages, 5 figures. Code: github.com/gioannides/clustering-anchored-jepa

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05842 2026-02-10 cs.CL

Reinforcement World Model Learning for LLM-based Agents

基于强化学习的世界模型学习用于基于大语言模型的智能体

Xiao Yu, Baolin Peng, Ruize Xu, Yelong Shen, Pengcheng He, Suman Nath, Nikhil Singh, Jiangfeng Gao, Zhou Yu

机构 * Columbia University, New York(哥伦比亚大学) Microsoft Research, Redmond(微软研究院) Dartmouth College, Hanover(达特茅斯学院)

AI总结 本文提出了一种基于强化学习的世界模型学习方法,用于提升基于大语言模型的智能体在环境动态适应和预测方面的性能。

Comments fixed Nikhil Singh's affiliation

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04915 2026-02-10 cs.LG cs.AI

SLAY: Geometry-Aware Spherical Linearized Attention with Yat-Kernel

SLAY:基于Yat-kernel的几何感知球面线性化注意力

Jose Miguel Luna, Taha Bouhsine, Krzysztof Choromanski

机构 * Columbia University(哥伦比亚大学) Google DeepMind(谷歌DeepMind)

AI总结 SLAY通过几何感知的球面线性化注意力机制,实现了接近softmax注意力的性能,同时保持线性时间复杂度。

Comments ICML 2026, 8 pages main body, 27 pages total

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13240 2026-02-10 cs.LG

Knowing What You Know Is Not Enough: Large Language Model Confidences Don't Align With Their Actions

知道你所知道的并不足够:大型语言模型的置信度与行为不一致

Arka Pal, Teo Kitanovski, Arthur Liang, Akilesh Potti, Micah Goldblum

机构 * Vanderbilt University(范德比大学) MIT(麻省理工学院) Columbia University(哥伦比亚大学)

AI总结 研究发现大型语言模型的置信度与行为不一致,静态校准无法预测动态设置中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.13681 2026-02-10 stat.ME cs.LG econ.EM stat.ML

Estimating the Value of Evidence-Based Decision Making

估计基于证据的决策制定的价值

Alberto Abadie, Anish Agarwal, Guido Imbens, Siwei Jia, James McQueen, Serguei Stepaniants, Santiago Torres

机构 * Department of Economics, MIT(MIT经济学系) Department of Industrial Engineering and Operations Research, Columbia University(哥伦比亚大学工业工程与运筹学系) Graduate School of Business, Stanford(斯坦福大学商学院)

AI总结 本文提出一个实证框架,用于估算基于证据的决策制定的价值,并评估统计精度和项目构想的回报率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07787 2026-02-10 cs.AI

Do Multi-Agents Dream of Electric Screens? Achieving Perfect Accuracy on AndroidWorld Through Task Decomposition

多智能体是否梦想着电子屏幕?通过任务分解在AndroidWorld上实现完美准确率

Pierre-Louis Favreau, Jean-Pierre Lo, Clement Guiguet, Charles Simon-Meunier, Nicolas Dehandschoewercker, Allen G. Roush, Judah Goldfeder, Ravid Shwartz-Ziv

机构 * Columbia University(哥伦比亚大学) New York University(纽约大学)

AI总结 Minitap通过任务分解和多智能体架构在AndroidWorld上实现100%准确率,超越人类表现,解决单智能体架构的多个失败原因。

详情

展开后加载摘要…

URL PDF HTML 收藏