AI News - Oscar's News

ESQ-Bench: 用于评估NL2SQL方言泛化和隐性语义分歧的多层级企业Oracle基准

arXiv cs.AI ·

ESQ-Bench使用复杂企业数据库模式引入了一个新的NL2SQL基准,用于评估语言模型在现实场景中将自然语言翻译为SQL的能力。虽然已建立的基准显示89%以上的准确性,但ESQ-Bench在复杂模式上显示出显著的性能下降,Claude Sonnet在各层级上超过GPT-4o。该基准识别出"隐性语义分歧"——查询能够成功执行但返回错误结果——作为影响73-99%的表面上通过的查询的关键失败模式。

测量检测通道压倒天文基础模型中的像素,偏置层析平均红移

arXiv cs.AI ·

对AION-1(一个在200多百万个天文对象上训练的39模态基础模型)的审计表明,测量检测元数据极大地偏置了预测结果,使其优先于实际图像内容。在保持图像不变的情况下修改检测掩码会使所有报告数量变化110-4400倍,预测与元数据的存在相关而非基础光分布相关。这种系统偏差传播到下游天文测量中,而这些测量对宇宙学巡天至关重要。

用于代码偏好优化的函数级执行反馈

arXiv cs.AI ·

STEP-KTODER提出函数级过程监督方法用于代码偏好优化,将步骤定义为模块级函数,并通过自动生成的单元测试分配正确性标签。该方法结合函数级反馈和结果级程序评估,显著优于仅基于结果的方法。分析表明执行级标签至关重要,而LLM作为评判工具的注解系统性地高估了失败率。该方法在多个代码生成基准测试上性能均有提升。

J next K prev V open O detail