基于地理空间人工智能(GeoAI)的电动汽车充电站选址
融合VAE与GCN的GeoAI框架预测充电站选址,F1达0.87,识别27个候选点并评估两种政策情景。
基于因果激活引导的大语言模型自适应多值控制
AIMES以中间层词表读数为在线观测,逐解码步自适应调节多价值激活干预强度,无需额外训练估计器。
导师式解码:更快推理遇上 Boosting
提出导师式解码,连接有损推测解码与Boosting,证明可加速推理且提升质量。
面向卷积自编码器的免训练瓶颈宽度规划
MS-SRD无需训练神经网络,即可按NMSE约束估算卷积自编码器瓶颈通道,预测误差低且多数精确。
分析并缓解编程智能体中的成本低效行为
首次研究编程智能体成本低效行为,识别三种模式并评估缓解策略;开发者设计技能可降本41.73%。
MDSkin-Net:模式分析先验与空间对齐正则化驱动的多任务皮肤病变分析
MDSkin-Net融合模式分析先验与空间对齐正则,提升皮肤病变分割分类的跨队列泛化。
措辞胜于顺序:Gemma 4 的行为评估
Gemma 4-e4b评估:来源框定强于阅读顺序;首因偏差随措辞波动,结构雷同放大位置偏好。
超越平均注意力:面向 KV 缓存淘汰的多样性感知逐层打分
KV缓存淘汰中,注意力打分加入离散度与冗余惩罚;全局多样性常数提升多数数据集,逐层搜索在检索任务中层现大幅增益。
假新闻理论:借助学科洞见进行计算建模、检测与解释
融合多学科理论,将假新闻说服传播机制转化为可测量特征,实现可解释检测,多特征组合通常更优。
学习跳过什么:高效多智能体LLM工作流的反事实信用分配
将组件省略建模为反事实信用分配,借助跳过干预学习可跳过的步骤,降低token开销并保持或提升准确率。
Timo:驯服多模态扩散Transformer实现人体运动生成
提出运动学感知多模态扩散Transformer框架Timo,用于人体运动生成,性能显著超越现有方法。
审计 System-1 模型在生物安全相关基准上的表现:非生成式模型的校准、选择性预测与排列不稳定性
审计商用System-1模型的生物安全基准校准与选择性预测:准确率依赖任务,选项顺序致37.4%答案翻转。
少说多"看":面向多模态大语言模型推理分割的潜在推理
LIRSeg以可学习潜在令牌替代显式思维链做推理分割,两阶段训练结合三项信息机制,兼顾精度与效率。
LAVOIR:以摊销信息价值教会单次前向决策编码器何时提问与问什么
单次前向决策模型在输出答案时,为缺失槽位估计提问的信息价值,学会何时问、问什么,少量提问即显著提准。
CRC-Router:面向医疗智能体AI系统的风险约束路由
提出风险约束路由模块CRC-Router,融合多源不确定性信号并经共形风险控制校准阈值,在胸片分诊中取得最优风险-覆盖权衡。
RAZOR:修剪大语言模型中的可替换专家
RAZOR:免训练专家剪枝,用共识残差评估可替换性,多模型多预算下性能领先。
动作风格滑块:面向人体动作扩散的端点监督连续风格控制
提出运动风格滑块,以端点监督构造风格方向,用标量强度控制扩散生成,实现平滑单调的连续风格调节。
理解提示模板在安全对齐知识蒸馏中的作用
知识蒸馏中提示模板影响安全对齐:聊天模板比非聊天模板更易顺从有害查询,非聊天模板更能保留学生表征。
面向鲁棒多模态情感分析的可靠性感知跨样本增强
提出RCE框架,利用不确定性建模与跨样本高置信校准,提升噪声和缺失模态下多模态情感分析鲁棒性。
面向跨域小样本学习的查询条件化原型自适应:单查询推理、受控比较与失效模式
WIPT以联合查询-支持变换生成查询专属原型,实现单查询跨域小样本自适应;仅局部提升,收益不普遍,主要改变不确定决策。
利用基于深度学习的形态学图谱改进分子-形态对比预训练
深度学习细胞图像编码提取更丰富形态图谱,改进MoCoP对比预训练,提升QSAR、毒性和ADME预测。
矩引导的边采样
提出基于谱矩的矩引导边采样框架,高效量化局部边编辑对全局结构的影响,并可解释、改善图学习。
中文标题:面向鲁棒成对LLM评判的主干自适应证据路由
提出BAER,按评判主干自适应路由证据机制并保持候选对称,八项设置均获最高准确率。
LLPR:面向单幅图像雨滴去除的位置感知学习与物理重建
提出LLPR框架,融合位置感知学习与物理重建,去除单幅图像雨滴,并发布真实数据集,超越现有方法。
视觉Token通信中全预算反事实推理的选择性摊销
提出ACV-Gate,选择性摊销全预算反事实评估,以少量候选评估提升视觉Token通信重建质量并降低编码计算。
在串联式语音到语音模型中利用随机化引导学习自然对话行为
提出随机化中间引导,免模拟后端LLM;3.8k小时真实对话训练提升轮次转换自然度,保持回复质量优势。
SEA-CLIP-Tiny:面向东南亚语言的高效多语言文本-视觉嵌入
提出不足50M参数的东南亚多语言文本-视觉嵌入模型SEA-CLIP-Tiny,在七种语言检索上领先同类学生模型,R@10较MobileCLIP2高12.1点且参数少38.4%。
HCOE:来自生物医学语言模型的双曲临床本体嵌入
HCOE将生物医学语言模型嵌入映射至庞加莱球,以本体对比学习与路径聚合实现层级感知临床概念表示。
I-Parakeet:移动端 NPU 上的纯整数 Conformer 语音识别
纯整数Conformer在手机NPU运行,无浮点/CPU回退,错误率4.97%,比CPU快7.5倍。
学习偏置:机器学习增强的粒子滤波
将学习到的提议分布融入粒子滤波,提出神经最优粒子滤波NOPF,提升样本效率与分布精度。
转写压缩对基于大语言模型的日语YouTube视频医疗虚假信息检测的影响
全文转写检测效果最佳;摘要、RAG等压缩均增加漏判,假视频更易被判为真。
持久负样本:面向对抗式黑箱同策略蒸馏
用历史提示匹配的师生对比替换部分判别器负样本,稳定奖励估计,同等算力下提升黑箱同策略蒸馏性能。
PolicyAttention:Softmax 注意力实现闭环控制的策略镜像下降
构建因果Softmax注意力闭环协议,迭代实现策略镜像下降,并用Transformer实证验证。
EXAONE Demand 1.0:面向需求预测的时间序列基础模型
提出EXAONE Demand,用1130万条需求序列及合成数据预训练,按四类需求设计低秩适配器与路由,在22个数据集上超越36个TSFM。
气候政策因果评估中识别假设的循证审计
ARGUS按十一维标准审计DID识别假设,无据即弃权,缺陷检出率73%,远超关键词法18%,并输出可溯源风险报告。
UltraG-Bench:评估大型视觉语言模型在超声像素级证据定位上的多任务基准
构建超声像素级证据定位多任务基准,含三类任务,评测14个模型揭示语义与定位差距,并提出改进智能体。
ManiVid:统一且可解释的篡改视频取证分析
ManiVid统一可解释视频篡改取证,构建38K数据集与ManiVidLens,检测、定位与解释领先。
ConsultMind:迈向基于不确定性感知推理的自动化诊断问诊
提出自动构建疾病-症状贝叶斯网络及不确定性感知诊断框架,显著提升诊断准确性与解释质量。
从标注到推理:语言模型中的文化
主张以文学阐释评估语言模型的文化引用与推理,结合证据基准、学者分歧与丹麦文学实验,提升文化稳健性。
熵正则化:面向已验证示范的交叉熵免费修正
交叉熵与验证器风险失配;熵正则化约束策略支撑,ER-CE 提升数学和代码验证准确率。
ToolSearcher:通过强化学习优化大规模工具选择
提出ToolSearcher强化学习框架,借助类别约束、事件级搜索建模与轨迹对齐信用分配,优化大规模工具选择。
CCRV-Bench:基于约束的视觉语言模型因果推理评估
提出约束驱动基准CCRV-Bench,四维评估视觉语言模型因果推理,发现约束敏感性因任务与模型而异,单一总分掩盖不同失败。
基于文本约束声学重打分的免训练发音转写
提出免训练语音-文本转发音流水线,用文本约束候选与预训练模型贪心重打分,大幅降低错误率且更快。
面向渐进式免COLMAP三维高斯泼溅的可靠性调控轨迹优化
可靠性调控轨迹优化框架,以自监督双向循环一致性抑制免COLMAP 3DGS渐进跟踪漂移,提升轨迹与渲染。
Spackle:用自适应高斯补全大视角单图新视角合成
Spackle三阶段残差学习缓解容量竞争:预测基础3DGS、定位差区域、学残差高斯,大视角NVS领先。
THA:面向高棉语的加权有限状态文本规范化与逆文本规范化
THA:高棉语加权有限状态文本/逆文本规范化开源工具,Google测试集准确率高。
面向大语言模型持续微调的未知预训练梯度估计与正交化
提出EoupCT框架,用可学习软提示生成易遗忘伪数据以估计预训练梯度,并通过帕累托优化强制正交,缓解灾难性遗忘。
OneWorld:在世界模型中学习跨动作一致的物理规律
提出OneWorld框架,用共享潜在物理机制联合建模多动作未来,提升跨干预物理一致性。
评估实时语音智能体:从组件质量到有据可依的结果
基于38项来源,主张实时语音智能体评估应从组件质量转向真实结果,并兼顾多方交互,提出TRG标准。
联邦目标最大似然估计
提出首个联邦目标最大似然估计算法,含梯度聚合与本地更新两框架,通信误差可忽略,隐私非自动保障。