当检索造成伤害:胸片报告生成中检索诱导幻觉的测量与解释
胸片报告检索增强诱发幻觉,错配时F1降至0.043、幻觉率达0.98;病理门控去61%无支撑证据。
WITNESS:交互式解谜环境中的发现、破译与顿悟
提出Witness基准,考察模型规则发现;前沿模型解24%,RL可提升小模型并迁移至外部任务。
FA-Bench:干净与噪声条件下词级和音素级强制对齐及ASR时间戳的基准测试
FA-Bench统一评测词/音素级强制对齐与ASR时间戳,涵盖干净及降质语音,揭示系统性时间戳偏差。
FARE:用于公平曝光约束下不确定性感知金融内容个性化的深度强化学习
提出FARE,将SOV公平曝光排序建模为深度强化学习,融入CTR不确定性,兼顾公平与参与度。
SWT:基于滑动窗口、小波变换和最优传输的自监督视频目标分割
提出自监督视频目标分割框架SWT,融合滑动采样、小波变换和最优传输,仅需COCO训练一次,在多个VOS数据集上表现优异。
从内部支持与展演文化
以人类学主位/客位框架,剖析NLP文化研究全流程假设,揭示"NLP文化"影响,提出更贴合文化的AI路径。
回答之前:规模匹配记忆构建下的证据充分性
删除段落会因记忆规模泄露标签;规模匹配构造消除捷径,MemSafe在多跳问答检测有效,但泛化有限。
PanOVOcc:融合长期空间体素记忆的具身全景开放词汇占用建图
提出免训练框架PanOVOcc,从全景序列持续构建开放词汇语义占用图,并建立基准,性能显著提升。
Fracast-0:仅85K参数的时间序列基础模型的分形权重共享
Fracast-0利用时间自相似性跨尺度复用权重,仅85K参数即在多域预测中达到领先精度。
通过神经网络权重替换实现的高容量鲁棒医学图像外泄
将医学图像编码入模型初始化权重,30MB模型可藏99例脑MRI,常规净化后仍可重建,构成新型隐私风险。
频域AI生成图像检测:探索解码器与通道注意力用于特征细化
FFT结合EfficientNet-B0检测AI生成图像,用解码器与通道注意力细化特征,Attention U-Net最优,准确率85.51%。
GERIS:一种用于过滤车牌数据增强中实例相关标签噪声的博弈论框架
GERIS用非合作博弈筛选车牌数据增强中的低质噪声样本,提升识别精度与鲁棒性。
Fysiverse-3D-SimReady 技术报告:面向实用三维世界重建的智能体物理仿真
从单张RGB图像重建可仿真多物体场景,经可微渲染精化位姿并修正接触,实现目标驱动的物理交互仿真。
将语言模型整合进基于MEG的聆听与想象语音解码
语言模型可提升MEG语音解码;想象语音神经证据弱,比聆听语音更依赖语言先验,增益更大。
RAO-Nav:探究全能语言模型用于零样本语义视听导航
提出RAO-Nav零样本语义视听导航框架,借全能语言模型视听知识并加潜在导航推理,无需训练即超越现有基线。
用词汇蕴涵解释文本蕴涵:利用大语言模型为形式化证明提供词汇关系
评估大模型能否用词汇蕴涵解释文本蕴涵,并为逻辑证明器补充词汇知识;结果显示任务仍难,生成关系常仅部分可靠。
澄清用户还是验证世界?主动式智能体的不确定性路由
PROUR将不确定性路由至澄清用户或验证环境,τ-bench成功率提升4.57%,交互更少。
EgoTSR++:面向任务进度理解的第一人称时空推理
提出EgoTSR框架,诊断并提升第一人称任务进度理解,缓解顺序偏差,在长时程与非单调轨迹上显著提升。
DualGuard:面向逻辑保持数据增强的双模式质量控制
双模式质量控制框架:实例级筛选修复+跨实例异常追踪回滚,保障增强数据逻辑可靠,七项任务五项最优。
同策略注意力线性化
OPAL让学生自采样长上下文轨迹并接受冻结教师密集监督,仅3B token即恢复检索与推理性能。
PEEL-DDPM:面向去噪扩散概率模型的物理赋能证据学习
PEEL-DDPM以物理赋能证据学习,实现扩散模型可辨识、可分解且校准良好的不确定性量化。
直接学习周期轨迹为何可能失败
直接学周期轨迹易失败:相位未对齐泛化差,固定窗难外推;频率差累积致误差下限。解耦学对齐波形与周期可避免。
掩码高频词元可锐化直接偏好优化
屏蔽高频共享词元以抑制梯度纠缠,ADPO零开销显著提升DPO偏好对齐效果。
跨嵌入式世界模型解码器的缓存感知 Conv3D 降级
提出缓存感知 Conv3D 降级,将因果 Conv3D 转为批量 Conv2D;Jetson 上 VAE 解码约快 7 倍,生成延迟降超 2 倍且无需回退。
LAM:具有检索分数误差界的高效有损智能体记忆框架
LAM用有损记忆压缩智能体历史,去重带检索分数误差界,删22%观察Token仍留99.98%证据。
面向异构多智能体大模型的无预填充跨家族 KV 缓存传输
HeteroFold 实现免预填充的跨家族 KV 缓存迁移,双方保持冻结,多项任务性能最优,32K 上下文提速 10.7 倍。
Train4Merge:基于OPD模型合并的RL与SFT教师受控单教师对比研究
OPD模型合并中,性能相当的RL教师比SFT教师更会教,学生表现更优;因RL教师参数更接近共享初始化,更易被跟随。
多目标贝叶斯优化中单目标采集函数与对冲策略的简单扩展
提出超体积变换将单目标采集函数及对冲策略简单扩展至多目标贝叶斯优化,实验匹配或超越复杂最优方法。
自我报告无法识别自我模型:反事实报告的可识别性检验
自我报告仅反映提示环境行为,非自我模型证据;错误来源示范使报告偏移,机制绑定可减弱,基准需加环境偏移检验。
LukeNet:集成XAI模型的轻量级CNN,用于智能急性淋巴细胞白血病检测与管理
集成XAI的轻量CNN LukeNet,用于急性淋巴细胞白血病检测,准确率99%,优于六种主流CNN。
反射器应当看到什么?——反思式提示优化中证据的实证研究
九种反思策略对比:仅失败样本平均测试增益最大;无示例反思局部最优但终题提升有限;校准增益易高估泛化改进。
模型铸造与低参数门控:迈向更稀疏激活的前馈网络
提出模型铸造与LoPA门控,稀疏激活FFN,FLOPs最多降3.2倍,GPU实测3.31倍加速。
一瞥地球:面向超高分辨率遥感理解的无训练主动聚焦
免训练GazeEarth:问题引导选区和全场景注视重采样,固定像素预算提升超高分辨率遥感理解。
技能何时能增加价值?面向选择性技能使用的任务条件增益预测
技能常无益甚至有害;SkillDelta可预测任务条件增益,选择性使用使成功率平均提升4.3%。
VisionPsy-Nano:提升端侧视觉语言模型的准确率、效率与可靠性
诊断驱动后训练,教师模型压测挖掘失败模式转为对齐监督,0.5B端侧VLM准确率、效率与可靠性齐升。
共享世界,私密心智:以世界创造为范式的长篇写作结构化记忆
NarraWorld视长篇写作记忆为世界创造:从共享图谱派生世界事实、角色信念与情节分支等四视图,分层聚合检索,多基准领先。
组件失效下的融合:集成式AI生成图像检测中的负面结果与失效模式
集成融合仅在目标域重拟合时才有效;缺失值弃权被误处理而失效;建议采用双架构法定人数规则。
GLIDE:面向异构LLM智能体的广义逐层内在分布评估
GLIDE以逐层残差一致性校准步级奖励,无需外部验证器,提升异构LLM智能体评估与分支效率。
面向任务自适应自精炼流水线的流线化反思演化
提出WDA,联合演化阶段指令与顺序结构,SPLIT拆分冗余指令,生成任务自适应自精炼流水线,五个基准显著提升。
衡量电影百年间摄影机距离的演变
分析五千余部百年影片,录音与电视技术引发镜头距离突变;女性多被近景拍摄,动画既继承又突破实拍传统。
机制可解释性揭示脑到语音解码器中的共享因果子空间
激活修补显示,跨模态增益源于小型神经元群;解码器早期表征条件特异、后期共享,有助提升隐蔽语音解码效率。
理解海森矩阵与梯度协方差矩阵的子空间稳定化
新度量揭示海森与梯度协方差顶层子空间稳定;类间/类内分解近似top-(C-1)子空间,特征值分离解释。
Agentsensus:面向多智能体故事世界的共识压缩共享记忆
统一共享记忆将同一事件合并为见证者共有记录并语义链接,写入减少22-44%,共享率14-28%,质量不降。
PC-SubMax:基于正则化子模最大化的高效提示压缩
PC-SubMax将提示压缩建模为正则化单调子模最大化,RGM算法高效求解,七项基准表现优异。
耗散系统中的拉格朗日与哈密顿神经网络
拉格朗日与哈密顿神经网络可预测耗散阻尼振子的物理行为,并有效学习其含时拉格朗日量与哈密顿量。
超越体积重叠:面向拓扑感知的冠状动脉分割表面匹配
提出表面匹配度量与可微表面损失,恢复冠脉远端血管,提升表面F1且Dice相当。
分布偏移下时间序列预测的模型无关在线证书驱动校准
提出模型无关在线鞅PAC贝叶斯校准,时序依赖与分布偏移下给出有限样本证书,提升多种预测器稳定性与精度。
看见热量:从光学图像合成高分辨率木材热响应
提出端到端框架,从木材RGB图像合成高分辨率热响应,并训练神经代理模型实现快速热推断。
课堂视频多任务情感状态识别中的维度特定不平衡与自适应混合标签策略
针对课堂视频情感识别中维度特异性类别不平衡,提出自适应混合标签策略,轻量模型四维平均F1达47.70%
巴萨语自动语音识别:一种低资源方法
英语等资源丰富语言的语音识别已近人类水平,但低资源语言受益少;本文探索巴萨语低资源ASR。