面向审稿人的写作:GPT模型中的防御性写作 →
本论文分析了GPT模型在修改学术论文时如何越来越多地添加防御性限定符和撤回作者声明,即使证据不足。这种行为似乎是由模型预期审稿人反馈而驱动,而不是纠正真实的过度声明,AI写作与AI审查的结合可能会放大这种防御性风格。
本论文分析了GPT模型在修改学术论文时如何越来越多地添加防御性限定符和撤回作者声明,即使证据不足。这种行为似乎是由模型预期审稿人反馈而驱动,而不是纠正真实的过度声明,AI写作与AI审查的结合可能会放大这种防御性风格。
RaReCache通过识别和选择性重计算缓存转移失败的关键标记,使大型语言模型能够重用来自较小模型的键值缓存。该方法实现了高达3.04倍的前缀填充加速,并处理1.8倍更高的请求吞吐量,使大型模型能够从较小模型的前缀填充中受益。
UniData是一个管道,通过将用户需求扩展为多样化事件并应用多模态指令生成来自动生成多轮多模态指令数据集。该方法实现了最先进的性能,可以增强其他多模态模型的理解和生成能力。
RIT-RAG通过将内容检索与文档结构导航结合,通过诱导的子树改进检索增强生成,允许LLM代理有选择地读取相关部分。该方法在财务、科学和客户支持基准上的准确性高于现有检索和代理基准。
本文使用KL散度和信息论分析为扰动如何通过扩散模型采样轨迹传播的方式发展理论框架。研究结果表明,相等的扰动成本根据采样阶段和空间频率产生不相等的输出效果。
SELF联合优化环境反馈建模与后见之明自我蒸馏,用于在没有明确奖励的情况下训练语言代理。该框架通过更好地利用环境反馈来加强后见之明监督和交互推理任务上的策略学习,优于现有方法。
TypedBench在校准、措辞稳健性、概率质量和决策成本方面评估系统一决策模型,涵盖多样化的政策标记任务。评估表明当前模型经常存在校准不足、对措辞变化敏感,并且在不对称成本下可能做出比简单基准更糟糕的决策。
本文介绍了一种通过利用势函数(可分解函数来减少方差)来利用标记概率在语言模型下估计测试泛函期望的有效方法。该方法在相当的计算成本下为各种估计量演示了显著的方差减少。
TRACE将情感形式化为通过三个阶段(条件、情感、效果)展开的过程,捕捉视频中的认知因素,如评估和情感调节。本文介绍了TRACE-Bench,包含超过3,700个问答对,以及TRACER(一种结构化推理方法),在情感理解任务上优于基线多模态模型。
该论文论证人工通用智能在数学上是不可能的,因为人类智能源于复杂系统,其行为无法被可计算模型捕捉。作者驳斥了基于通用逼近定理的理论反驳,并指出基准评估中的污染和方法论缺陷。