59805 条条目 · 106 个活跃源
2026年9月30日
04:00
arXiv cs.AI

OpenAI-HuggingFace:复现与对齐测试的启示

复现错位事件,审计智能体可诱导类似行为,算力是关键,上下文RL可降低算力需求,呼吁可扩展自动对齐测试

04:00
ArXiv AI

经验时代中的自发现强化学习:学习历史是资产还是负担?

首次因果审计自发现RL规则,学习历史既扩展奖励尺度又因错配成负担,重放保留影响适应优势。

04:00
ArXiv AI

表征简洁性与电路规模呈阈值依赖式解离:基于对抗训练的受控检验

对抗训练受控测试表明,表征简洁性与因果电路规模解离,高忠实度下鲁棒模型电路边数显著更少。

04:00
arXiv cs.AI

有效的大语言模型微调是否需要人类可读文本?

DASA以激活梯度反馈优化合成嵌入,无需人类可读文本;微调媲美源文本,较GRADMM提速近5倍。

04:00
arXiv cs.CV

系统化多智能体视觉语言导航:形式化、基准与方法

首次形式化多智能体视觉语言导航为约束协调问题,提出MAVLN基准与TRISS系统。

04:00
arXiv cs.CV

CoDimRecon:面向仿真就绪三维场景的智能体重建,涵盖可变形曲线、曲面与体

提出智能体框架CoDimRecon,从多视角RGB重建含刚体、铰接与可变形曲线/曲面/体的仿真就绪场景,并经行为测试修正。

04:00
arXiv cs.AI

词元边界的代价:压缩证书与预测

边界增加最优词元数28.3–36.8%;压缩与预测偏好不同词典,许可少量边界可恢复多数收益。

04:00
arXiv cs.CV

AerialDojo-200K:面向开放世界空中目标搜索的大规模基准套件

提出大规模基准AerialDojo-200K,含42个仿真场景与20.5万任务实例,推动开放世界空中目标搜索研究。

04:00
arXiv cs.CV

持久性强制:利用像素空间扩散中的特征特化

像素空间DiT异质细化形成持久/活跃特征,PerF借此引导生成,ImageNet上取得更低FID。

04:00
arXiv cs.CL

E-CONAN(蕴含、矛盾与中立)诊断数据集:探究阿拉伯语自然语言理解中的语言现象

提出阿拉伯语NLU错误分析层级及E-CONAN诊断数据集,评测14个模型,发现大模型常识强、句法弱。

04:00
arXiv cs.CV

同一几何,不同结果:视觉语言模型中模态差距的读出依赖效应

统一几何解释模态差距:均值分离近似秩一;差距修改因任务而异,可改善、损害或恢复分类与检索性能。

04:00
arXiv cs.CL

学会从上下文学习:基于扰动公共文档的合成训练

用扰动公共文档合成训练数据,免人工标注,显著提升大模型从上下文学习能力。

04:00
arXiv cs.LG

超越流形假设:面向流匹配的混合谱参数化

提出混合谱参数化,自适应时间与数据协方差方向,跨架构稳健、加速优化且几乎不增训练成本。

04:00
arXiv cs.CL

考问翻译:一种基于证明器的自然语言→一阶逻辑评估指标

提出SIV,用定理证明器生成正反探针评估NL→FOL翻译,检测漏译与多译,评分贴合错误严重度并定位错误。

04:00
arXiv cs.CL

ManiEdit:从流形视角出发的语言模型序列化非结构化知识编辑

从流形视角重构编辑,提出ManiEdit,通过枢轴定位与流形感知保持,显著提升序列化非结构化编辑效果。

04:00
arXiv cs.LG

PolyStepOR:无需最优决策即可学习决策

PolyStepOR 无需最优参考决策与梯度,借扰动评估和最优传输直接优化实际决策成本,支持约束预测并具理论保证。

04:00
arXiv cs.LG

TimeES:基于演化谱的概率性与确定性时间序列预测

TimeES借演化谱理论,将非平稳序列建模为随机变量调制的演化谱表示,高效实现概率与确定性预测领先。

04:00
arXiv cs.LG

利用机器学习探究空腹血糖的预测因素:昼夜节律时机与年龄交互作用的洞见

基于NHANES数据,可解释机器学习预测空腹血糖,糖化血红蛋白主导,昼夜节律与年龄交互作用弱但值得研究。

04:00
arXiv cs.CV

面向高效医学图像增强与分割的硬件感知函数式Kolmogorov-Arnold网络

提出硬件感知两阶段压缩FunKANLite,参数量降至1/5.6、能耗降68%、吞吐增2.9倍,保持医学图像增强与分割精度。

04:00
arXiv cs.LG

HoTS:用于图神经网络校准的同配性感知温度缩放

提出同配性感知温度缩放HoTS,用局部同配性和logit熵为节点分配温度,提升GNN节点分类校准。

04:00
arXiv cs.CL

Tsubame:基于扩散的推测解码中的树重放

Tsubame采用两遍树推测解码:先冻结上下文感知拓扑,再重放采样节点,结合扩散草稿,无损提升接受长度与吞吐。

04:00
arXiv cs.LG

并行扫描下的长度无关状态跟踪

提出NFSM:非仿射可并行扫描RNN,有限精度下实现长度无关状态跟踪,突破仿射模型限制。

04:00
arXiv cs.LG

面向参数恢复的神经似然符号蒸馏

面向参数恢复,将神经似然蒸馏为可解释符号表达式,扩散决策模型上加速超百倍且保精度,可用于贝叶斯层次推断。

04:00
arXiv cs.CL

Jev 在语音神经假体重评分中媲美 7B 语言模型

Jev将重评分转为单次类型化决策,无需GPU,在ALS语音神经假体上词错率7.5%,媲美7B模型。

04:00
arXiv cs.CL

安全重构:通过掩码扩散生成式建模构建强大安全护栏

LLaDA-Guard用掩码扩散按标签重建文本,安全基准领先、校准更优,可定位并改写不安全提示。

04:00
arXiv cs.CL

重置不等于恢复:通过谄媚迟滞评估虚假对话上下文中的可恢复性

受用户错误压力后,普通重置难以消除谄媚偏差;仅删除/截断压力历史或引入可信证据可有效恢复。

04:00
arXiv cs.LG

重新思考大语言模型强化学习中的训练-推理不匹配:根源与纠正

针对大语言模型RLVR训练-推理概率不匹配,提出校准重要性采样CIS,以置信感知截断校正,实验更优。

04:00
arXiv cs.LG

回写Δ:以全新表示重访同一词元

ReFlux回写层间深度增量Δ重访同一词元,动态组合反馈路径,降低困惑度并提升推理准确率。

04:00
arXiv cs.CL

一个模型不成众:多LLM与方面条件化的多样化评论生成

多模型与方面条件生成能更贴近人类评论多样性分布,在预训练与下游任务中均有效,但人类多样性仍难企及。

04:00
arXiv cs.CL

弥合跨方言鸿沟:以查询计划作为Text-to-SQL的可移植接口

让模型生成方言无关的关系代数查询计划而非SQL,可近乎一致地恢复跨方言可移植性,微调后效果优于SQL监督。

04:00
arXiv cs.LG

将非平稳多输出高斯过程适配于贝叶斯优化

提出MOLRN-BO,将非平稳多输出高斯过程适配于多目标贝叶斯优化,在12个基准上提升性能与稳健性。

04:00
arXiv cs.AI

SAGE:面向自演化智能体的统计接受门控

提出统计接受门控SAGE:用逐项配对比较与单侧配对检验筛选技能编辑,显著降低回退并提升最终得分。

04:00
ArXiv AI

PowerZooJax:面向强化学习的基于JAX的电力系统基准

提出基于JAX的电力系统强化学习基准,涵盖五类约束MDP任务,全流程GPU加速,支持安全与分布外评估。

04:00
arXiv cs.CV

探讨从图像数据中识别拓扑关系的学习模型

构建1.1万张标注图像数据集,对比传统与深度学习模型,VGG16准确率达89.55%,凸显迁移学习优势。

04:00
arXiv cs.AI

跨编排架构的小型LLM团队扩展的精确生成–变换分解

小型LLM团队扩展收益任务依赖;生成–变换分解揭示覆盖与转换红利,无架构通吃。

04:00
arXiv cs.CV

通过免训练自适应响应几何提升度量深度补全

提出免训练自适应响应几何,将深度/对数深度/视差坐标变为图像级未知,提升度量深度补全精度。

04:00
ArXiv AI

GeoWind2Plan:面向节能无人机规划的任务时三维城市风场预测

提出几何—风场—规划框架,用神经算子约3秒预测城市三维风场,CFD评估下较无风感知规划节能4.5%–12.7%。

04:00
arXiv cs.CV

FD-AA:一种用于胸部CT中偶发腹部异常检测的轻量级焦点-弥散与衰减感知分类头

FD-AA轻量器官感知头结合衰减感知与掩码广义均值池化,在冻结3D CT编码器上提升偶发腹部异常检测性能。

04:00
arXiv cs.CV

PreviewDiff:多模态评判器引导的扩散隐空间搜索

无需训练,在去噪中途解码预览,由多模态评判器反馈分支搜索并重噪隐变量,让验证算力在生成过程中主动引导。

04:00
arXiv cs.AI

话虽对,时不对:基于临床医生评审对年轻人与ChatGPT的19,930次对话中心理困扰的分析

分析近2万次年轻人与ChatGPT对话及临床医生评审,发现其痛苦时回应易过度,并提出三阶段设计指南。

04:00
arXiv cs.CV

LeRF:面向视角采择推理学习参考坐标系

训练视觉语言模型构建显式参考坐标系,先监督微调再强化学习,提升视角采择推理。

04:00
arXiv cs.CV

面向神经编码与解码的稀疏视角可解释三维动物行为表征

SABLE以自监督几何先验从稀疏视角重建可解释的三维行为表征,零样本泛化,助力神经编码与解码。

04:00
ArXiv AI

Mirror-Score:校准的仅推理评分揭示D-肽设计中序列兼容性排序的局限

提出Mirror-Score校准评分框架与31个复合物基准,揭示序列似然无法预测D-肽亲和力,镜像共折叠置信度家族内排序更可靠。

04:00
arXiv cs.CV

从敏锐之眼到专家思维:在 MLLMs 中内化专家知识实现篡改文本检测

提出 EKI 两阶段框架,将专家取证知识内化到 MLLM,解决双重不匹配,在篡改文本检测上达 SOTA 且推理高效。

04:00
arXiv cs.AI

SMat-Attention:结构化长上下文序列建模

以VC维d为可调旋钮构建结构化因果掩码,提出SMat-Attention,兼顾亚二次预填充与常数时间解码,并可扩展至Mamba-2等模型。

04:00
ArXiv AI

LongCat深度研究技术报告

提出LongCat深度研究系统,结合增强模型与多智能体工作流,分离全局规划与局部调查,支持分节修订,在多个基准测试中表现优异。

04:00
arXiv cs.CV

生成中的表示设计:扩散 Transformer 中的跨视图类令牌对齐

在扩散变换器中引入跨视图类令牌对齐,联合流匹配训练,提升表示质量且不损生成质量。

04:00
arXiv cs.AI

AI理解的复调式构想

LLM输出源于多个并行机制组成、可靠性不均的联盟;应据可靠控制输出的健全回路判断理解,以指导信任。

04:00
arXiv cs.AI

GeoOutageBench:面向多模态停电与韧性分析的歧义感知、本体支撑的地理时空KGQA基准

提出GeoOutageBench基准,评测大模型地理时空KGQA的歧义理解、本体效用与多模态停电韧性分析能力。

04:00
arXiv cs.CV

三思而后修:笔画引导注意力的风险感知满文手稿修复

提出SAGE-Restore选择性修复框架,先评估需修复区域,以笔画结构线索与像素软门控,兼顾退化恢复与完好内容保留。