DTBench: A Synthetic Benchmark for Document-to-Table Extraction
DTBench:文档到表格提取的合成基准
Yuxiang Guo, Zhuoran Du, Nan Tang, Kezheng Tang, Congcong Ge, Yunjun Gao
机构
*
Zhejiang University(浙江大学)
;
The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))
;
The Hong Kong University of Science(香港科学与技术大学)
专题命中
评测与基准
:LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
Understanding the Fundamental Design Decisions of Retrieval-Augmented Generation Systems
理解检索增强生成系统的基本设计决策
Shengming Zhao, Yuchen Shao, Yuheng Huang, Jiayang Song, Zhijie Wang, Chengcheng Wan, Lei Ma
机构
*
Fudan University(复旦大学)
;
East China Normal University(华东师范大学)
;
Shanghai Innovation Institute(上海创新研究院)
;
The University of Tokyo(东京大学)
;
Macau University of Science and Technology(澳门科学理工学院)
;
Concordia University(Concordia大学)
;
University of Alberta(阿尔伯塔大学)
;
The University of Tokyo, Japan(日本东京大学)
专题命中
评测与基准
:LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)
SAC-Opt: Semantic Anchors for Iterative Correction in Optimization Modeling
SAC-Opt:优化建模中用于迭代修正的语义锚点
Yansen Zhang, Qingcan Kang, Yujie Chen, Yufei Wang, Xiongwei Han, Tao Zhong, Mingxuan Yuan, Chen Ma
机构
*
Department of Computer Science, City University of Hong Kong, Hong Kong SAR, China(香港城市大学计算机科学系)
;
Huawei Noah's Ark Lab, Hong Kong SAR, China(华为诺亚实验室(香港))
;
Huawei's Supply Chain Management Department, Shenzhen, China(华为供应链管理部(深圳))
专题命中
评测与基准
:LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
CommentsAccepted as a poster at the Foundation Models Meet Embodied Agents (FMEA) Workshop, CVPR 2026. 44 pages including appendix. Code: https://github.com/Avalon-S/PInVerify
The Surface You Test Is Not the Surface That Breaks
测试的表面并非断裂的表面
Shifat E Arman, Syed Nazmus Sakib, Nafiul Haque, Shahrear Bin Amin
机构
*
Department of Robotics and Mechatronics Engineering, University of Dhaka(达卡大学机器人与机电工程系)
;
Department of Computer Science and Engineering, University of Dhaka(达卡大学计算机科学与工程系)
专题命中
评测与基准
:LLM(summary_cn,abstract);分类 cs.AI
AI总结
本文发现工具增强的LLM代理对提示注入的脆弱性依赖于攻击表面(工具输出 vs 工具描述),提出自适应攻击率并强调评估需报告每个表面的脆弱性。
Comments8 Figures, 8 Tables, Under Review at EMNLP
G-STAR: End-to-End Global Speaker-Tracking Attributed Recognition
G-STAR: 端到端全局说话人跟踪属性识别
Jing Peng, Ziyi Chen, Haoyu Li, Yucheng Wang, Duo Ma, Mengtian Li, Yunfan Du, Dezhu Xu, Kai Yu, Shuai Wang
机构
*
Nanjing University(南京大学)
;
Shanghai Jiao Tong University(上海交通大学)
;
Central Media Technology Institute, Huawei(华为中央媒体技术研究院)
;
Shenzhen Research Institute of Big Data(深圳大数据研究院)
;
ETH Zürich(苏黎世联邦理工学院)
Goldfish: Monolingual Language Models for 350 Languages
Goldfish: 面向350种语言的单语语言模型
Tyler A. Chang, Catherine Arnett, Zhuowen Tu, Benjamin K. Bergen
机构
*
Department of Cognitive Science(认知科学系)
;
Department of Linguistics(语言学系)
;
Department of Computer Science(计算机科学系)
;
University of California San Diego(加州大学圣地亚哥分校)
机构
*
Hong Kong University of Science and Technology(香港科技大学)
;
Nanyang Technological University(南洋理工大学)
;
Northwestern Polytechnical University(西北工业大学)
;
Southeast University(东南大学)
;
Huazhong University of Science and Technology(华中科技大学)
机构
*
Google DeepMind(谷歌DeepMind)
;
Indian Institute of Technology Bombay(印度理工学院孟买分校)
;
International Centre for Theoretical Sciences, Tata Institute of Fundamental Research(理论科学国际中心, Tata 基础研究机构)
专题命中
评测与基准
:large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
CommentsAccepted to RLEval @ ACM CAIS 2026 (Workshop on Methods and RL Environments for Evaluating AI Agents) and selected for an invited talk based on reviewer ratings. 4-page short paper + appendix