基于强化学习的分类算法正确选择以预测非酒精性脂肪肝
提出强化学习四阶学习法自动选择分类算法,预测原发性胆汁性肝硬化,准确率从63%升至98%。
地球观测嵌入中可恢复的地理位置信息
三种地球观测模型嵌入均可恢复地理位置,AlphaEarth最佳;建议地理信息含量纳入模型审计。
临床意图抽取:一种与FHIR对齐的表示方法及CIRCA基准
提出临床意图抽取任务与FHIR对齐表示,构建万条意图的CIRCA基准,模型字段全对率仅18-35%。
面向机器人操作:从混合质量部署经验中学习
提出PACL:以预测式动作块评论家将Q值转为质量条件,让扩散策略从混合质量自主经验中有效学习。
谁把“我”放进了AI?溯源与机器自我报告的可采性
溯源显示,大模型自我报告多受后训练与提问框架塑造,不能作为其意识主张的证据。
YODAS v3:超过100万小时的高带宽、立体声、多语言语音
发布YODAS v3:超110万小时48kHz多声道147语种语音,最大开源高保真立体声语音数据集。
当诚实不足以应对 AI 辩论时
结论正确不等于诚实:辩论智能体可借表达自由度隐蔽传递信息。本文提出SIO框架,量化任务与披露的权衡。
FounRef:基于稀疏锚点的冻结单目基础先验的鲁棒、保结构、快速度量精化
FounRef免训练,用稀疏锚点校验对齐冻结单目基础先验,快速生成保结构稠密度量深度,精度鲁棒性俱佳。
ImCorr:通过隐式特征解码实现亚像素级语义对应
ImCorr以连续隐式特征解码消除网格量化误差,提升细粒度语义对应,[email protected]提高6.2个百分点。
受生长启发的图生成与机械点阵逆向设计:通过点矩阵数据库增强和GCNN
受生长启发逐层生成机械点阵,GCNN预测刚度并逆向设计,验证误差小,可扩展至非线性弯曲梁形状编程。
BranchShine-CR:采用自条件CTC与一致性正则化的紧凑多语言国际音标转写
提出25M参数模型BranchShine-CR,用自条件CTC与一致性正则做多语言IPA转写,错误率4.47%,较基线降22.3%。
通过可组合接口从异构原位观测实现生成式大气超分辨率
可组合接口将稀疏异构大气观测融入预训练扩散模型实现超分辨率;R+A+S使ERA5 RMSE降9.24%。
如何以提示行事
对比2000条ChatGPT提示可见,用户指令日趋间接、隐含、碎片化,礼貌标记减少,愈发依赖模型推理补全。
ALOE:面向知识编辑的语义寻址低秩算子
ALOE 学习语义地址,将门控低秩算子嵌入 MLP,单次前向即可精准编辑知识且保持局部性。
策略即代码:面向 CAR-bench 快速推理可靠性的协程桥接测试框架
协程桥接框架让模型仅输出可阻塞恢复的Python程序,解耦模型调用与工具往返,以60% Pass^3夺冠。
认知概率模型:面向受保护多智能体LLM协作
提出EPLA神经符号架构,以符号守卫控制LLM动作,用认知概率模型协调不确定性下的多智能体。
阿拉伯语—俄语机器翻译基准评测:丰富形态与低词汇重叠下微调NMT与少样本大语言模型的比较
基于15.47M新语料,微调NLLB-1.3B的BLEU最高(16.3),远超少样本LLM;低词汇重叠是主要失败原因。
精确一次究竟活在哪里?模型、智能体框架与工具契约对 LLM 智能体重复副作用的影响
LIMBO实验:重复副作用取决于故障——可回读时由模型决定,不可回读时靠工具幂等键契约。
EnSiTa——面向领域特定机器翻译的三语多领域平行数据集与评测基准
发布英、僧伽罗、泰米尔三语七领域平行数据集,系统评测六向领域机器翻译。
面向自主智能系统中BT与FSM的LLM驱动统一转换框架
提出LLM驱动FSM与BT统一转换框架,实现自动语义一致双向转换,缓解状态爆炸并提升可扩展性。
双时间尺度演员-评论家算法的集中界
推导长期平均奖励下双时间尺度演员-评论家算法的一致集中界,证明演员误差高概率收敛并随更新减小。
用于解释时间序列分类器的可学习时频掩码
提出XACT,在可逆时频变换系数上学习稀疏归因掩码,解释时序分类器,精准且少虚假特征。
SARFusion:面向鲁棒相机-LiDAR 3D目标检测的场景感知路由融合
提出SARFusion,将相机-LiDAR融合重构为场景感知分支路由,逐查询自适应选择相机、LiDAR或融合分支,增强鲁棒3D检测。
PROOF:面向大语言模型对象级事实可靠性的画像式评测
PROOF基准用18,486道多选题画像化评测大模型事实覆盖,揭示领域差异、改写敏感与过度自信。
StepCOPS:面向语言模型策略选择的闭合检验下尾证书
StepCOPS用提议集提名候选下尾底线,经二项检验与Holm逐步法认证,选定策略覆盖率达96.4%,底线较基线高1.5分。
跨模型不动点普查在重复问题上能裁定什么、不能裁定什么
跨模型短窗不动点普查17个预训练模型:重复类别稳定且普遍,但无法完全仲裁重复源于数据还是网络。
资源受限设备上的边缘AI:动态环境中的二值睡眠—觉醒分类
ESP32-S3惯性+视觉多模态边缘AI,实现运动检测96.5%、姿态分类89%的睡眠-觉醒判别。
当判断无人所属:人机协作中贡献消解下的问责
提出"无主判断":以AI辅助评审与创作隐瞒为例,指出披露规则局限,主张区分AI角色、明确人类担责判断。
并非每个词元都值得蒸馏:面向 Direct-OPD 的选择性监督
Direct-OPD 对每个状态都施加监督,但低 JSD 状态下该信号近乎无效;S²D-OPD 按 JSD 排序,每条回答仅保留前 10% 状态,八项设置中七项提升。
PHOSA:照片级真实3D手语数字人建模与基准
发布与聋人专家共建的多视角中文手语数据集,提出混合SMPL-X拟合与解耦式3D手语数字人建模,高保真并泛化单目视频。
小型MLA-SSM混合语言模型的探索性消融研究
MLA-SSM混合模型消融:移除SSM损失最大,移除MLA影响小;稠密FFN优于三元MoE,省显存。
面向联合发射预编码与STAR-RIS系数优化的粒子群辅助梯度元学习算法
提出粒子群辅助梯度元学习算法,联合优化预编码与反射/透射系数以最大化加权和速率,性能优于交替优化。
SkinAgent AI:面向非诊断性护肤支持的安全锚定多模态智能体框架
安全约束的非诊断护肤多模态智能体SkinAgent AI:视觉路由表现佳,系统任务完成有限,仍需独立验证与临床评估。
ModularSQL:面向Text-to-SQL多重性盲区的运行时护栏
暴露Set-EX多重性盲区,提出Multiset-EX评测与轻量运行时防护ModularSQL。
从文本决策到像素:Jev 式视觉选择模型研究
PixelJev将图像、指令与候选集映射为选择及概率;少量适配令Pets准确率升至92%并可迁移。
IronViT:迈向高效通用视觉表示学习
该模型先整合多专家能力再约束计算,经注意力桥蒸馏并迁移至混合注意力编码器,兼顾通用表征与高分辨率效率。
TTLab在AlexandriaX-2026:用于阿拉伯语机器翻译错误片段检测与分类的微调表层标注器
将阿拉伯语MT错误片段检测建模为表层词级分类,结合焦点损失与方言阈值,MARBERTv2最优,排名第三。
TOLA:面向扩散式文本图像超分辨的文本感知单步潜在适配
提出TOLA单步潜在适配,以置信度加权文本条件与潜在残差校正抑制OCR误识、恢复笔画,达最优性能。
延迟且被修订结果下的下行受控在线预测组合
延迟修订结果下,在线组合冻结预测器与校正器,仅用成熟损失控下行:最差劣化0.15%,收益11.5%。
最后的人类关卡:面向治理自动化的前线部署工程
提出数字治理任务替代框架:明确智能体替代人工审查关卡的条件,并以基准验证其可行性。
超越简单的输入-输出评估任务:利用自动化编程评估应对非平凡课程
将机器学习问题构建为输入-输出评估任务,使自动化编程评测工具有效支持AI教学,促进理论与实践结合。
视觉语言模型的域重定心与置信度加权先验校准
提出免训练CLIP校准法DRC,经高斯混合重定心与置信度加权先验校正,跨域精度最高且优于零样本。
BridgeMem:用于时序知识图谱预测的因果成对转移残差
BridgeMem通过为冻结预测器加入查询实体与候选间成对历史转移的因果残差校正,在五个基准上一致提升MRR和Hits指标。
FB-GDM:基于无监督变分推断的高维线性逆问题全贝叶斯引导扩散模型
FB-GDM用无监督变分推断实现全贝叶斯引导扩散,免调参,仅需观测和算子,高维线性逆问题中优于ΠGDM且更稳健。
双曲多模态持续学习:一种最近容许解
提出HMCL,将保持旧多模态几何化为共享双曲等距,用最近容许校正修正更新,显著减少漂移并提升性能。
纵向视野的深度学习预测青光眼进展速率并识别快速进展者
GLAM深度学习模型仅凭纵向视野序列即可预测青光眼进展速率,识别快速进展者AUC达0.990。
语言特异性与领域多样性:面向孟加拉语医学命名实体识别的Transformer基准评测
孟加拉语医学NER基准:XLM-RoBERTa微调最优(F1 0.5959),多语模型优于语言专用模型,提示法远逊。
基于可解释神经网络的协同DCT图像去噪极限研究
提出可微架构DeepBM3D,融合非局部分组、DCT域维纳滤波与多阶段细化,超越经典基线,重复纹理表现尤佳。
Baszta:面向数据的波兰语多标签安全分类器微调
微调波兰语多标签安全分类器:微F1略优,但基准97%为犯罪类,宏F1才具判别力;OOD实为校准问题。
SEE Challenge 2026:宽光照范围内的事件引导亮度调整
赛事用SEE-600K评测宽光照事件引导亮度恢复,PSNR排名,15份提交;极暗下各系统仍见误差。