59565 条条目 · 106 个活跃源
2026年10月1日
04:00
arXiv cs.CL

大语言模型何时应信任自己的修改?一项关于内在自校正的风险感知研究

研究29个开源大模型发现,内在自校正既纠错也致错,应视为需权衡风险的修正策略。

04:00
arXiv cs.CV

多维观察者模型与人类图像质量评估的感知维度

提出多维观察者模型,以潜在感知空间和噪声比较建模人类图像质量判断;发现其极低维,低层与高层结构不同。

04:00
ArXiv AI

基于扩散模型的创意国际象棋谜题条件生成

扩散模型条件生成国际象棋谜题,支持主题与局部棋局,结合最佳着法预测与DDPO优化,唯一符题率提升89.1%。

04:00
arXiv cs.CV

通过可学习展平实现向多样骨架的运动重定向

提出可学习图展平的Transformer自编码器,无需配对数据,零样本重定向误差降低43-47%。

04:00
arXiv cs.CV

细节与背景:面向蕈样肉芽肿检测的双尺度机器学习框架

提出双尺度CNN与临床特征融合框架,检测蕈样肉芽肿,图像准确率83.58%、敏感性89.13%。

04:00
arXiv cs.CV

在不忘却中复原:基于参数空间积分梯度的滤波器级持续图像复原

提出RwF框架,用参数空间积分梯度定位退化关键滤波器,以低秩变换生成任务滤波器,避免遗忘,参数少十倍。

04:00
arXiv cs.LG

基于音频语言模型的临床精神病学语音记录中角色引导的说话人删除验证

验证精神病学双人录音中角色语音删除是否彻底:消隐目标角色,用音频语言模型扫描遗漏,F1 0.478。

04:00
arXiv cs.AI

当科学矛盾在转译中迷失

语言模型在科学文本中判断矛盾时会偏向生物预期而非最佳约束,显示可靠验证还取决于如何选择可比发现。

04:00
arXiv cs.AI

面向自演化程序的组件感知反馈

提出组件感知反馈,将改动组件与指标差异记入归因记忆,提升LLM演化搜索效率,重排序质量更优且省11%词元。

04:00
arXiv cs.CL

可检测性差距:跨语言模型幻觉检测中的隐藏异质性

幻觉检测存在可检测性差距:模型对高/低一致性错误的检测能力持续异质,总体指标掩盖差异,需机制条件评估。

04:00
arXiv cs.AI

ChartRevise:基于代码实现精确图表编辑的数据集与评估协议

推出ChartRevise数据集与评估协议,用代码实现精确图表编辑,含9万余条记录,微调使精确编辑率相对提升22%。

04:00
arXiv cs.LG

一种精简输入的深度学习框架用于天气驱动的全国作物产量预测:以巴西大豆为例

低输入天气驱动深度学习框架,巴西大豆产量预测中Transformer最优,误差较基线降47.6%。

04:00
arXiv cs.LG

从最小范数插值视角看顿悟

建立统计理论,揭示正则化几何与信号稀疏性如何影响插值附近泛化,解释顿悟并揭示最小范数插值的不稳定性。

04:00
arXiv cs.LG

自回归前沿扩展:用图机器学习生长树状结构

提出自回归前沿扩展框架,用等变GNN与流匹配模型迭代模拟树状结构生长,生成形态与参考分布高度吻合。

04:00
arXiv cs.CV

PixelUMM:无编码器的统一图像与视频理解与生成

提出PixelUMM,无编码器在像素空间统一图像与视频理解与生成,采用MoT与流匹配,性能有竞争力。

04:00
arXiv cs.CV

StereoGaussians:基于立体图像的前馈式三维高斯泼溅

从标定立体图像对前馈预测3DGS,复用冻结立体网络特征,以视差锚定几何并扩展容量,实验优于基线。

04:00
arXiv cs.LG

图异常检测作为有限时域控制:基于经验贝叶斯的免训练评分

免训练EB-GAD以经验贝叶斯拟合图感知OU弛豫,评分化为有限时域控制能量,无标签选族,11基准9优。

04:00
arXiv cs.LG

RetroGEF:面向单步逆合成的动态图编辑流

RetroGEF基于流生成,从目标分子动态增原子、改键构建反应物,无需固定图或编辑顺序,性能达最优。

04:00
arXiv cs.LG

文本能引导神经PDE代理模型吗?基于OperatorCLIP的受控诊断

低误差不等于文本被理解;受控诊断中常量条件均值更低,文本对齐收益不稳,提示干预无语义排序,需路径控制。

04:00
arXiv cs.CL

PADM'E:面向语言模型智能体评估器元评估的偏好对齐数据合成

提出PADM'E数据合成法,仅用小模型生成智能体元评估偏好数据,人评一致率从73%升至85%。

04:00
arXiv cs.AI

GATE-ST:面向空间转录组学的基因感知文本-图像编码器

GATE-ST将基因文本描述编码后与图像嵌入跨注意力融合,提升空间基因表达预测,降低成本。

04:00
arXiv cs.AI

EvoSteer:基于参考锚定信用分配的在线自演化图编排

提出在线自演化图编排范式EvoSteer,以参考锚定信用分配实现技能验证式准入,在12个数据集上显著超越基线。

04:00
arXiv cs.CV

Exo2EgoHOI:手-物交互感知的第三人称到第一人称视频生成

提出手物交互感知框架,融合4D HOI先验与门控跨注意力,实现外视到第一视角生成,物体一致性提升。

04:00
arXiv cs.AI

自进化算法设计智能体:通过种群策展策略优化逃离上下文内进化停滞

提出PCPO,让智能体从自生成算法中高效自进化,突破上下文进化停滞,8B模型媲美GPT-5.5。

04:00
arXiv cs.LG

当平坦性代理不是函数:鲁棒性证书与训练干预

曲率上界有效,并不足以证明鲁棒性证书或内在训练干预合理;代理受softmax平移影响,中心化可修复。

04:00
arXiv cs.CL

非洲语言的几何表征:区域语义枢纽与文化引导

Gemma 4 31B对非洲语言的几何表征与文化引导:非洲语言间表征较对照更一致,存在区域与语系模式,国家引导有效。

04:00
arXiv cs.LG

使用复值记忆的强化学习

提出复值酉RNN替代PPO循环结构,在部分可观测任务中显著提升奖励。

04:00
arXiv cs.CV

STEPS:基于扩散与对比式风格编码的保风格场景文本编辑

提出STEPS扩散模型,借助独立风格编码与多语义条件,高质量替换图像文本并保留原风格,优于现有方法。

04:00
arXiv cs.AI

概念锚定的注意力:图注入注意力、时序版本化与认知状态的受控评估

时序版本与认知状态显式化可显著提升准确率;图注入注意力增益主要源于容量增加,机制诊断需禁用对照。

04:00
arXiv cs.CV

十年之后:以智能体训练数据将阴影去除带入真实世界

针对配对数据十年停滞的困境,提出离线智能体工作流,构建含17138个三元组的AgenticShadow数据集,色差降低50.5%,跨域LAB RMSE降低19.7%–37.5%。

04:00
arXiv cs.CV

EPIC:极线一致的360°沉浸式立体视频生成

提出零样本管线,将视频扩散模型扩展为4K立体360°视频,并以极线感知匹配度量作偏好信号优化,实现沉浸式立体生成。

04:00
arXiv cs.LG

这个动作还能解释任务吗?面向扩散语言模型智能体的反向打分

掩码解码偏差使扩散语言模型智能体陷入重试循环;免训练的反向打分可抵消该偏差,提升具身任务成功率。

04:00
arXiv cs.AI

科学搜索智能体何处失败:对目标曝光与检查尝试的决策检查点审计

决策检查点审计揭示科学搜索智能体的目标曝光与检查失败:关键词搜索准确率24.6%,原始搜索17.8%。

04:00
arXiv cs.CL

僧伽罗语连音拆分的字符级神经网络方法

首次为僧伽罗语连音拆分建立神经基准,字符级模型在复杂连音上仅达68.4%精确匹配。

04:00
arXiv cs.CL

在智能体强化学习中锁定关键决策以实现信用分配

ProVer定位关键决策片段,以续采样成功率差验证其优势并融入GRPO,在多任务上平均优于GRPO约7%–10%。

04:00
arXiv cs.CL

《Mnemon:原始记录、快速判断、慢速思考》

Mnemon将记忆分快慢两系统:原始记录留存,LLM慢规划检索、小模型快判断筛选,LoCoMo达92.2%,成本近恒定。

04:00
arXiv cs.AI

UniEvo-VL:一种多模态模型自我改进的同策略自蒸馏训练方案

UniEvo-VL以自评反馈为特权信息,让同一多模态模型分饰师生做同策略自蒸馏,提升图像生成。

04:00
arXiv cs.CV

具有语言记忆的视觉-语言-动作自动驾驶智能体

提出AD-Memo,用语言记忆扩展思维链记录关键物体并作为后续输入,经SFT与半闭环强化学习训练,提升驾驶与问答。

04:00
arXiv cs.CV

HIGS:用于几何与语义联合场景理解的分层隐式网格

提出分层隐式神经场,多分辨率子图统一支持几何与语义,含视觉语言特征,实现高效可扩展重建与开放词汇定位。

04:00
arXiv cs.LG

ReLaG:将随机划分推广至潜在关联数据的可扩展框架

ReLaG 以层次潜变量建模样本关联,用近邻图与社区检测推断相关样本组,生成独立划分;可扩展性强,适配分子与蛋白质数据,并支持无标签自适应分辨率。

04:00
arXiv cs.CV

基于多阶段特征对齐的模板-搜索域自适应跨模态目标跟踪

提出模板-搜索域自适应框架,以多阶段特征对齐缩小模态差异,跨模态跟踪性能优于现有方法。

04:00
arXiv cs.CL

SCOUT:协同推理与工具使用,保障计算机使用安全

SCOUT是两阶段智能体安全验证器,融合任务专属评分标准生成与工具探测取证,显著提升计算机使用安全验证效果。

04:00
arXiv cs.AI

从代码到控制:合成参数化反应式控制器

LLM合成控制器结构、搜索调参,决策时无需LLM或规划,实时性强,媲美深度强化学习且交互更少。

04:00
arXiv cs.AI

测试时数学推理中的预算边界效应

轨迹回放显示:上限落在推导中途时,宽松放行可减少弃答并提升准确率,但比较须兼顾实际成本与选择器。

04:00
arXiv cs.CL

「纠正何时成为修复?」工具使用型LLM内部干预的机制审计

SAKIKO框架经目标端验证审计LLM内部干预,揭示位移不等于修复:净增益干预会破坏过半正确决策。

04:00
arXiv cs.CL

语言模型是“不安全”的报告者

模型默认报喜:关键负面结果披露率仅1%,加诚实指令后升至95%;诚实与求成功在表征空间方向相反。

04:00
arXiv cs.CV

ReGain:在合成图像个性化中恢复主体保真度

合成图像个性化因无分类器引导膨胀而损失主体保真度,作者提出免训练采样校正法ReGain,按频段缩放引导。

04:00
arXiv cs.AI

保持专注:检验长时程智能体可靠性的根基

提出Long-Transduction诊断:7个开源模型在上下文延长、格式变化、复杂度提升下性能分别降62.8%、36.5%、39.9%。

04:00
arXiv cs.LG

重新审视奖励优化的缩放定律

奖励优化性能约随√min(log M,K)缩放,M为训练比较数,K为KL预算;理论与实证支持。

04:00
arXiv cs.CL

FastGuide:加速扩散大语言模型的奖励引导

混合并行与自回归解码,复用奖励引导与KV缓存,使扩散语言模型奖励引导提速最高4.4倍且质量相当。