并非所有4比特量化器都相同:微调小语言模型中PII泄露的部署时缓解
量化方法影响隐私:有校准的AWQ、GPTQ不泄露植入记录,无校准GGUF泄露5.3%,AWQ最优。
迈向可持续的磁共振成像:来自整个扫描仪队列长期高分辨率能耗记录的洞察
单次MRI检查平均耗电13.5 kWh,待机与节能模式累计耗能超过扫描,能耗更受扫描时长影响。
IndustrialVLA-Bench:面向开放机器人策略模型的可追溯多轴评估
提出可追溯多轴评测基准,统一对比六种VLA与WAM系统:清洁能力接近,鲁棒性与指令敏感性差异显著。
PICPIs:以预测区间为条件的预测区间
提出以预测区间为条件的预测区间:自洽使条件均值落在同区间,形成自适应分层,覆盖多数预测值,服务决策。
West-WRF AI 2公里:高分辨率积分水汽输送与降水预测
美国西部2公里AI模型可6小时预报降水与积分水汽输送,在局地极端降水和大气河强水汽输送中表现最佳。
RGSQ:面向大型视觉语言模型的黎曼几何敏感量化
RGSQ以Fisher-黎曼度量统一建模量化误差,识别模态敏感方向并旋转对齐,极低比特下精度领先。
超越自然语言:面向自主科学的智能体原生语言
提出机器可检验语言Lara,将研究论证变为可执行构件,自动验证、跨论文连接并毫秒级复核主张状态。
面向CS1例题主动学习的自我解释辅导系统
为CS1编程例题构建大模型自我解释辅导系统,即时反馈;评估可靠,促学生修改完善解释并学习。
PaCo-VLA:面向富接触视觉-语言-动作操作的无源性屏蔽柔顺先验
PaCo-VLA将VLA输出转为任务级柔顺提案,并用高频无源性屏蔽保障接触操作安全,提升插接精度。
AgenticRL:面向复杂无人机导航的自精炼智能体强化学习
多模态闭环生成、诊断失败、精炼奖励;八项无人机任务成功率最高100%,仿真37.2%升至96.4%,真机90%。
注意力感知路由:在 MoE 中耦合路由与注意力
提出AAR:以注意力权重滑窗特征增强路由器,仅训路由参数,GSM8K提升3.37pp,并揭示路由与注意力的深度耦合。
SpecOpt:面向结合特异性的智能体分子优化接触差异推理
SpecOpt对已有药物做受限修饰以提升靶标选择性,基于残基接触差异推理,84.8%化合物获改善。
RBS-Attention:面向长上下文大语言模型的半径受限稀疏预填充
提出免训练稀疏预填充RBS-Attention,双分支缓解均值稀释,长上下文提速且精度近稠密。
基于SAS视觉Transformer的LoRA增强对比学习
LoRA微调DINOv3声呐目标识别,仅训0.26%参数,AUPRC从0.3升至0.68,精炼无增益。
CaLR:面向鲁棒扩散推理的因果潜在修正
提出CaLR,以因果潜在优化融合AR与扩散优势,梯度引导思维修正实现并行自纠错,复杂基准达SOTA。
中文标题:基于多样性剪枝测试的信息增益奖励:面向可靠代码生成的基准真值锚定验证器协同训练
CoVer框架以信息增益奖励筛选自生成测试并做多样性剪枝,代码生成pass@1最高提升7.1分。
面向情感认知诊断的能力-残差解耦建模
提出能力-残差解耦框架,显式建模认知残差以抑制情感污染,提升认知诊断预测与情感对齐。
《生产环境中的高效基准评测:一项关于持续演进的LLM智能体的研究》
比较四种采样策略,2PL自适应测试精度最高;实际部署难度分层固定子集,可跨模型迁移且免重校准。
面向感知任务规划的全可微神经-软符号框架
提出全可微神经软符号框架,连接视觉感知与规划,以连续软符号和可微规则实现反馈,提升成功率并减少计算。
PolyBridgeBench:面向物理落地的桥梁设计多模态大语言模型基准评测
可执行桥梁设计基准,测试多模态大模型生成承载结构及仿真失败后修复能力,六模型189关显示动态成功与修复力不足。
DENSE:将智能体轨迹蒸馏为基于证据的捷径树以实现自我精炼
将智能体轨迹中的进展与恢复证据蒸馏为嵌套捷径树,免结果标注实现自反馈精炼,提升通过率并减少token。
LogicTrack:用形式逻辑求解器审计大语言模型的推理轨迹
LogicTrack 用形式逻辑求解器逐步验证推理链,并以回溯奖励引导搜索,提升可验证性与准确率。
GVPO++:面向大语言模型后训练与同策略蒸馏的组方差策略优化
提出GVPO,将KL约束奖励最大化解析解融入梯度加权,免重要性采样,可扩展至同策略蒸馏。
安全导向端到端自动驾驶的风险感知占用
提出风险感知占用统一编码场景、地图约束与未来智能体占用,设计ROIDrive注入规划查询,显著降低碰撞率。
通信瓶颈:语言模型中树结构表达式序列化的往返研究
提出往返协议评估语言模型对树结构表达式的序列化,发现通信有损且不对称,失败多源于生成,微调可提升。
降低学术支持障碍:评估课程专用RAG系统以解决高等教育中的求助差异
研究评估课程专用RAG系统,发现其可降低求助障碍,提供可信且与课程一致的支持,成为正式求助前的桥梁。
校准师生差异的在线策略蒸馏
通过特权干预估计教师自身偏差以校准师生差异,仅学习真实能力差距,推理基准上稳定优于标准OPD。
一个提示词难以包打天下:面向个性化信息抽取的自元演化
提出自元演化框架,为每位用户迭代定制信息抽取提示,基准成功率74.58%,真人评估71%胜出。
MIST:基因组引导的组织学注意力下的多模态生存预测
MIST以基因组令牌查询组织学上下文,结合掩码与对比对齐训练,在四类肿瘤外部验证中提升C指数。
AutoRecLab:描述实验,获取代码!
AutoRecLab 可将自然语言实验设计自动转为推荐系统实验代码,结合 RAG 与执行引导树搜索,9 次运行 8 次成功,单次成本约 1 美元。
学习心脏特征:跨时间与运动场景的心电生物识别
在运动与跨会话变化下评估心电生物识别,多导联孪生网络实现休息至峰值EER 1.7%、CYBHi上3.9%。
ResNLS:一种改进的股价预测模型
提出ResNLS混合模型,ResNet提取股价依赖,LSTM结合残差预测;前5日输入最优,较当前最优提升超20%,回测可降损盈利。
dSTAR:容忍落后者且拜占庭容错的分布式SGD
提出dSTAR,聚合前k个响应节点梯度,以集成中位数过滤偏差,抗落后者与拜占庭攻击,保持高精度。
潜在空间中的基于物理的渲染
在潜在空间引入基于物理渲染,修改渲染方程并用可微渲染器优化场景参数,少量微调即可生成并泛化。
PlantShade:面向光照感知机器人农业作业的植物阴影预测
构建四类作物多生长阶段动态阴影数据集,提出基于扩散模型的植物阴影生成方法,支持农业机器人感知与光照控制。
LLM 生成的 GPU 内核实际能覆盖真实工作负载的多少?
前沿LLM在KernelBench正确率达91.1%,56题中22题获验证加速;但真实负载可优化占比仅8.9%–58.2%,Transformer端到端上限约1%;提出DLRM-Bench并揭示评测缺陷。
更少步骤,更佳动作:重新思考VLA策略的流匹配推理
提出Coda:流匹配积分预算转为单次端点校正,冻结策略少步生成,轻量Transformer预测残差,仅训校正器;RoboTwin上成功率提升、延迟降低,两步提速2.12倍。
CESBench:面向物联网设备密码工程安全的大语言模型基准测试
CESBench含380道专家题,覆盖物联网密码工程安全六大子域;选择题与代码表现强,安全判定理由最弱。
WS-NeRF:一种Mamba驱动的世界状态感知自适应去模糊神经辐射场
WS-NeRF以时序记忆优化辐射场,融合世界状态与专家混合调整去模糊先验,显著提升模糊场景重建质量。
FOCAL-VLA:面向视觉-语言-动作模型的子任务引导几何蒸馏与隐式世界建模
提出FOCAL-VLA,以子任务引导几何蒸馏和隐式世界建模,聚焦当前交互相关几何与动态,提升精细长程操作性能。
AtomEgo:探索第一人称视角与机器人融合的具身基础模型预训练
约2659小时人类第一人称数据用于具身模型预训练研究,提出数据规模×对齐质量决定能力增益的原则。
CityLearn v3:面向可再生能源社区真实控制研究的可配置仿真与评估框架
可配置仿真评估框架CityLearn v3,统一建模动态成员、负荷截止、需求响应与故障,区分请求与实际动作。
SynthDemo-RL:以LLM引导的合成演示突破VLA适配中的零奖励壁垒
以合成演示替代人类示教,SFT蒸馏结合PPO微调,在LIBERO-PRO将27个零成功任务全部攻克,平均成功率97.8%
ForceTwin:基于仪器化人类交互的物理信息数字孪生用于机器人操作
借力觉夹爪采集人类交互,辨识惯性摩擦与机构动力学,构建物理数字孪生,提升机器人操作成功率。
Gricea:面向对话式AI研究的开放科学平台
Gricea将对话式AI研究转化为可配置、可部署、可复用的研究制品,支持复现、共享与扩展,促进开放科学下的知识累积。
面向个性化睡眠支持的智能体式即时自适应干预系统:基于单被试(N=1)数据的概念验证研究
智能体睡眠即时自适应干预系统概念验证:自动审查30天数据并调整提醒,每日限三条,展示技术可行性。
Touvigation:面向盲人与低视力用户在陌生室内环境的具身自适应物体获取
Touvigation融合视觉语言理解与持久空间建模,为盲人提供低延迟具身导航,12人测试成功率100%,优于多模态助手与无辅助搜索。
CIPL:面向 LLM 智能体中可恢复隐私泄露的通道感知框架
CIPL:通道感知黑盒框架,评估 LLM 智能体隐私泄露,发现存储标签不等于可恢复,泄露受观察面与检索深度影响。
失败的机器人何时该求助?基于审计传感器证据发起纠正性人机对话
机器人失败时应自诊断、换传感器还是问人?决策应依据实测传感器证据与成本,而非模型自信。
面向LLM智能体可控观点动力学的贝叶斯信念层
提出BCA信念层,分离信念与表达,以κ编码固执度,可复现共识、分歧与少数派影响,并支持审计。