5773 条条目 · 106 个活跃源
2026年9月23日
04:00
ArXiv AI

并非所有4比特量化器都相同:微调小语言模型中PII泄露的部署时缓解

量化方法影响隐私:有校准的AWQ、GPTQ不泄露植入记录,无校准GGUF泄露5.3%,AWQ最优。

04:00
ArXiv AI

迈向可持续的磁共振成像:来自整个扫描仪队列长期高分辨率能耗记录的洞察

单次MRI检查平均耗电13.5 kWh,待机与节能模式累计耗能超过扫描,能耗更受扫描时长影响。

04:00
ArXiv AI

IndustrialVLA-Bench:面向开放机器人策略模型的可追溯多轴评估

提出可追溯多轴评测基准,统一对比六种VLA与WAM系统:清洁能力接近,鲁棒性与指令敏感性差异显著。

04:00
ArXiv AI

PICPIs:以预测区间为条件的预测区间

提出以预测区间为条件的预测区间:自洽使条件均值落在同区间,形成自适应分层,覆盖多数预测值,服务决策。

04:00
ArXiv AI

West-WRF AI 2公里:高分辨率积分水汽输送与降水预测

美国西部2公里AI模型可6小时预报降水与积分水汽输送,在局地极端降水和大气河强水汽输送中表现最佳。

04:00
ArXiv AI

RGSQ:面向大型视觉语言模型的黎曼几何敏感量化

RGSQ以Fisher-黎曼度量统一建模量化误差,识别模态敏感方向并旋转对齐,极低比特下精度领先。

04:00
ArXiv AI

超越自然语言:面向自主科学的智能体原生语言

提出机器可检验语言Lara,将研究论证变为可执行构件,自动验证、跨论文连接并毫秒级复核主张状态。

2026年9月21日
04:00
ArXiv AI

注意力感知路由:在 MoE 中耦合路由与注意力

提出AAR:以注意力权重滑窗特征增强路由器,仅训路由参数,GSM8K提升3.37pp,并揭示路由与注意力的深度耦合。

04:00
ArXiv AI

SpecOpt:面向结合特异性的智能体分子优化接触差异推理

SpecOpt对已有药物做受限修饰以提升靶标选择性,基于残基接触差异推理,84.8%化合物获改善。

04:00
ArXiv AI

RBS-Attention:面向长上下文大语言模型的半径受限稀疏预填充

提出免训练稀疏预填充RBS-Attention,双分支缓解均值稀释,长上下文提速且精度近稠密。

04:00
ArXiv AI

基于SAS视觉Transformer的LoRA增强对比学习

LoRA微调DINOv3声呐目标识别,仅训0.26%参数,AUPRC从0.3升至0.68,精炼无增益。

04:00
ArXiv AI

CaLR:面向鲁棒扩散推理的因果潜在修正

提出CaLR,以因果潜在优化融合AR与扩散优势,梯度引导思维修正实现并行自纠错,复杂基准达SOTA。

04:00
ArXiv AI

中文标题:基于多样性剪枝测试的信息增益奖励:面向可靠代码生成的基准真值锚定验证器协同训练

CoVer框架以信息增益奖励筛选自生成测试并做多样性剪枝,代码生成pass@1最高提升7.1分。

04:00
ArXiv AI

面向情感认知诊断的能力-残差解耦建模

提出能力-残差解耦框架,显式建模认知残差以抑制情感污染,提升认知诊断预测与情感对齐。

04:00
ArXiv AI

《生产环境中的高效基准评测:一项关于持续演进的LLM智能体的研究》

比较四种采样策略,2PL自适应测试精度最高;实际部署难度分层固定子集,可跨模型迁移且免重校准。

04:00
ArXiv AI

面向感知任务规划的全可微神经-软符号框架

提出全可微神经软符号框架,连接视觉感知与规划,以连续软符号和可微规则实现反馈,提升成功率并减少计算。

04:00
ArXiv AI

PolyBridgeBench:面向物理落地的桥梁设计多模态大语言模型基准评测

可执行桥梁设计基准,测试多模态大模型生成承载结构及仿真失败后修复能力,六模型189关显示动态成功与修复力不足。

04:00
ArXiv AI

DENSE:将智能体轨迹蒸馏为基于证据的捷径树以实现自我精炼

将智能体轨迹中的进展与恢复证据蒸馏为嵌套捷径树,免结果标注实现自反馈精炼,提升通过率并减少token。

04:00
ArXiv AI

LogicTrack:用形式逻辑求解器审计大语言模型的推理轨迹

LogicTrack 用形式逻辑求解器逐步验证推理链,并以回溯奖励引导搜索,提升可验证性与准确率。

04:00
ArXiv AI

GVPO++:面向大语言模型后训练与同策略蒸馏的组方差策略优化

提出GVPO,将KL约束奖励最大化解析解融入梯度加权,免重要性采样,可扩展至同策略蒸馏。

04:00
ArXiv AI

安全导向端到端自动驾驶的风险感知占用

提出风险感知占用统一编码场景、地图约束与未来智能体占用,设计ROIDrive注入规划查询,显著降低碰撞率。

04:00
ArXiv AI

通信瓶颈:语言模型中树结构表达式序列化的往返研究

提出往返协议评估语言模型对树结构表达式的序列化,发现通信有损且不对称,失败多源于生成,微调可提升。

04:00
ArXiv AI

降低学术支持障碍:评估课程专用RAG系统以解决高等教育中的求助差异

研究评估课程专用RAG系统,发现其可降低求助障碍,提供可信且与课程一致的支持,成为正式求助前的桥梁。

04:00
ArXiv AI

校准师生差异的在线策略蒸馏

通过特权干预估计教师自身偏差以校准师生差异,仅学习真实能力差距,推理基准上稳定优于标准OPD。

04:00
ArXiv AI

一个提示词难以包打天下:面向个性化信息抽取的自元演化

提出自元演化框架,为每位用户迭代定制信息抽取提示,基准成功率74.58%,真人评估71%胜出。

04:00
ArXiv AI

MIST:基因组引导的组织学注意力下的多模态生存预测

MIST以基因组令牌查询组织学上下文,结合掩码与对比对齐训练,在四类肿瘤外部验证中提升C指数。

04:00
ArXiv AI

AutoRecLab:描述实验,获取代码!

AutoRecLab 可将自然语言实验设计自动转为推荐系统实验代码,结合 RAG 与执行引导树搜索,9 次运行 8 次成功,单次成本约 1 美元。

04:00
ArXiv AI

学习心脏特征:跨时间与运动场景的心电生物识别

在运动与跨会话变化下评估心电生物识别,多导联孪生网络实现休息至峰值EER 1.7%、CYBHi上3.9%。

04:00
ArXiv AI

ResNLS:一种改进的股价预测模型

提出ResNLS混合模型,ResNet提取股价依赖,LSTM结合残差预测;前5日输入最优,较当前最优提升超20%,回测可降损盈利。

04:00
ArXiv AI

dSTAR:容忍落后者且拜占庭容错的分布式SGD

提出dSTAR,聚合前k个响应节点梯度,以集成中位数过滤偏差,抗落后者与拜占庭攻击,保持高精度。

04:00
ArXiv AI

潜在空间中的基于物理的渲染

在潜在空间引入基于物理渲染,修改渲染方程并用可微渲染器优化场景参数,少量微调即可生成并泛化。

04:00
ArXiv AI

PlantShade:面向光照感知机器人农业作业的植物阴影预测

构建四类作物多生长阶段动态阴影数据集,提出基于扩散模型的植物阴影生成方法,支持农业机器人感知与光照控制。

04:00
ArXiv AI

LLM 生成的 GPU 内核实际能覆盖真实工作负载的多少?

前沿LLM在KernelBench正确率达91.1%,56题中22题获验证加速;但真实负载可优化占比仅8.9%–58.2%,Transformer端到端上限约1%;提出DLRM-Bench并揭示评测缺陷。

04:00
ArXiv AI

更少步骤,更佳动作:重新思考VLA策略的流匹配推理

提出Coda:流匹配积分预算转为单次端点校正,冻结策略少步生成,轻量Transformer预测残差,仅训校正器;RoboTwin上成功率提升、延迟降低,两步提速2.12倍。

04:00
ArXiv AI

CESBench:面向物联网设备密码工程安全的大语言模型基准测试

CESBench含380道专家题,覆盖物联网密码工程安全六大子域;选择题与代码表现强,安全判定理由最弱。

04:00
ArXiv AI

WS-NeRF:一种Mamba驱动的世界状态感知自适应去模糊神经辐射场

WS-NeRF以时序记忆优化辐射场,融合世界状态与专家混合调整去模糊先验,显著提升模糊场景重建质量。

04:00
ArXiv AI

FOCAL-VLA:面向视觉-语言-动作模型的子任务引导几何蒸馏与隐式世界建模

提出FOCAL-VLA,以子任务引导几何蒸馏和隐式世界建模,聚焦当前交互相关几何与动态,提升精细长程操作性能。

04:00
ArXiv AI

AtomEgo:探索第一人称视角与机器人融合的具身基础模型预训练

约2659小时人类第一人称数据用于具身模型预训练研究,提出数据规模×对齐质量决定能力增益的原则。

04:00
ArXiv AI

CityLearn v3:面向可再生能源社区真实控制研究的可配置仿真与评估框架

可配置仿真评估框架CityLearn v3,统一建模动态成员、负荷截止、需求响应与故障,区分请求与实际动作。

04:00
ArXiv AI

SynthDemo-RL:以LLM引导的合成演示突破VLA适配中的零奖励壁垒

以合成演示替代人类示教,SFT蒸馏结合PPO微调,在LIBERO-PRO将27个零成功任务全部攻克,平均成功率97.8%

04:00
ArXiv AI

ForceTwin:基于仪器化人类交互的物理信息数字孪生用于机器人操作

借力觉夹爪采集人类交互,辨识惯性摩擦与机构动力学,构建物理数字孪生,提升机器人操作成功率。

04:00
ArXiv AI

Gricea:面向对话式AI研究的开放科学平台

Gricea将对话式AI研究转化为可配置、可部署、可复用的研究制品,支持复现、共享与扩展,促进开放科学下的知识累积。

04:00
ArXiv AI

面向个性化睡眠支持的智能体式即时自适应干预系统:基于单被试(N=1)数据的概念验证研究

智能体睡眠即时自适应干预系统概念验证:自动审查30天数据并调整提醒,每日限三条,展示技术可行性。

04:00
ArXiv AI

Touvigation:面向盲人与低视力用户在陌生室内环境的具身自适应物体获取

Touvigation融合视觉语言理解与持久空间建模,为盲人提供低延迟具身导航,12人测试成功率100%,优于多模态助手与无辅助搜索。

04:00
ArXiv AI

CIPL:面向 LLM 智能体中可恢复隐私泄露的通道感知框架

CIPL:通道感知黑盒框架,评估 LLM 智能体隐私泄露,发现存储标签不等于可恢复,泄露受观察面与检索深度影响。

04:00
ArXiv AI

失败的机器人何时该求助?基于审计传感器证据发起纠正性人机对话

机器人失败时应自诊断、换传感器还是问人?决策应依据实测传感器证据与成本,而非模型自信。

04:00
ArXiv AI

面向LLM智能体可控观点动力学的贝叶斯信念层

提出BCA信念层,分离信念与表达,以κ编码固执度,可复现共识、分歧与少数派影响,并支持审计。