61876 条条目 · 106 个活跃源
2026年9月28日
04:00
arXiv cs.CL

从标注到推理:语言模型中的文化

主张以文学阐释评估语言模型的文化引用与推理,结合证据基准、学者分歧与丹麦文学实验,提升文化稳健性。

04:00
arXiv cs.LG

熵正则化:面向已验证示范的交叉熵免费修正

交叉熵与验证器风险失配;熵正则化约束策略支撑,ER-CE 提升数学和代码验证准确率。

04:00
arXiv cs.CL

ToolSearcher:通过强化学习优化大规模工具选择

提出ToolSearcher强化学习框架,借助类别约束、事件级搜索建模与轨迹对齐信用分配,优化大规模工具选择。

04:00
arXiv cs.CV

CCRV-Bench:基于约束的视觉语言模型因果推理评估

提出约束驱动基准CCRV-Bench,四维评估视觉语言模型因果推理,发现约束敏感性因任务与模型而异,单一总分掩盖不同失败。

04:00
arXiv cs.CL

基于文本约束声学重打分的免训练发音转写

提出免训练语音-文本转发音流水线,用文本约束候选与预训练模型贪心重打分,大幅降低错误率且更快。

04:00
arXiv cs.CV

面向渐进式免COLMAP三维高斯泼溅的可靠性调控轨迹优化

可靠性调控轨迹优化框架,以自监督双向循环一致性抑制免COLMAP 3DGS渐进跟踪漂移,提升轨迹与渲染。

04:00
arXiv cs.CV

Spackle:用自适应高斯补全大视角单图新视角合成

Spackle三阶段残差学习缓解容量竞争:预测基础3DGS、定位差区域、学残差高斯,大视角NVS领先。

04:00
arXiv cs.CL

THA:面向高棉语的加权有限状态文本规范化与逆文本规范化

THA:高棉语加权有限状态文本/逆文本规范化开源工具,Google测试集准确率高。

04:00
arXiv cs.CL

面向大语言模型持续微调的未知预训练梯度估计与正交化

提出EoupCT框架,用可学习软提示生成易遗忘伪数据以估计预训练梯度,并通过帕累托优化强制正交,缓解灾难性遗忘。

04:00
arXiv cs.CV

OneWorld:在世界模型中学习跨动作一致的物理规律

提出OneWorld框架,用共享潜在物理机制联合建模多动作未来,提升跨干预物理一致性。

04:00
arXiv cs.AI

评估实时语音智能体:从组件质量到有据可依的结果

基于38项来源,主张实时语音智能体评估应从组件质量转向真实结果,并兼顾多方交互,提出TRG标准。

04:00
arXiv cs.LG

联邦目标最大似然估计

提出首个联邦目标最大似然估计算法,含梯度聚合与本地更新两框架,通信误差可忽略,隐私非自动保障。

04:00
arXiv cs.CV

MVVBench:面向视觉语言模型的4D推理基准评测

真实多摄像机多视角推理基准,题目单视角或单时刻均不可解,覆盖六类能力,暴露模型时序定位与跨视角身份缺陷。

04:00
arXiv cs.CV

DAPEVO:深度自适应块帧-事件视觉里程计

DAPEVO在共享块位置独立估计图像与事件对应并融合证据,RGB帧稀疏时仍稳健,精度显著优于现有方法

04:00
arXiv cs.AI

HasMem:面向长期LLM智能体的硬源自适应软化记忆

提出HasMem:冻结硬提示作初态,控制器调记忆宽度,写入器重编码,读写器全局适配,提升F1并降低NLL。

04:00
arXiv cs.CL

FAVoR:度量与缓解联邦个性化生成中的作者风格同质化

联邦个性化生成中,标准聚合会抹平作者风格;FAVoR用共享-私有适配器保留作者残差,提升风格留存。

04:00
arXiv cs.AI

共享智能体记忆中认知准入的基准与诊断研究

提出CPB基准评测共享记忆的声明准入,发现缺乏源谱系的策略难以拒绝虚假声明。

04:00
arXiv cs.AI

PTC-Decoder:迈向离线资源受限边缘设备上的智能小语言模型

免训练即插即用PTC-Decoder,以规划为工具并用有限自动机约束工具名,提升边缘小模型多步任务可靠性。

04:00
ArXiv AI

为何扩散语言模型中的越狱能够成功:能量景观分析

提出能量景观框架,将越狱归为初始模糊或中途跨越,导出三个免训练检测信号,实验验证互补有效。

04:00
arXiv cs.LG

在储备池计算框架下对秀丽隐杆线虫连接组进行基准测试

用储备池计算基准测试秀丽隐杆线虫连接组,发现生物连接与仿生配置未必更优,随机对照常更优,且受配置与来源影响。

04:00
arXiv cs.AI

SkillEvoReg:为智能体技能演化抵御过拟合的正则化

提出SkillEvoReg正则框架,缓解智能体技能演化过拟合,抑制冗余膨胀并保持能力。

04:00
arXiv cs.LG

生产规模下的自动研究:失效模式与多智能体框架

生产级AutoResearch揭示五类失效模式,提出“预防-持久-重定向”框架,召回率提升1.82倍。

04:00
arXiv cs.CV

IDM-Net:一种用于低光照图像增强的轻量级光照解耦调制网络

IDM-Net用双编码器提取RGB外观与亮度光照先验,经光照引导调制实现亮度与色彩的平衡,轻量高效。

04:00
arXiv cs.CL

耦合用法—义项过程:时序性与可归因的词汇语义变化

提出CUSP,从单一时间过程同时揭示词义变化的幅度、时间、机制、成分移动与文本归因。

04:00
arXiv cs.LG

在线凸优化中带指示切换成本的动态遗憾

提出元学习算法,在指示切换成本下实现动态遗憾近最优界,无需预知比较器切换数或路径长度。

04:00
arXiv cs.LG

GyroNovo:面向从头肽测序的误差引导片段插补与质量感知注意力

GyroNovo利用解码误差引导缺失片段插补,并以旋转嵌入编码峰间质量差,显著提升从头肽测序精度。

04:00
arXiv cs.AI

TISD:带轨迹干预的在线策略自蒸馏

提出TISD:教师选分支、学生续写、特权教师蒸馏全轨迹,缓解在线自蒸馏数据瓶颈并在编程和科学任务提升。

04:00
ArXiv AI

思考有助于公平吗?推理标记解决了一些偏见,却制造了更多

思维对反事实公平有不对称双重效应:在九个模型-数据集组合中,新产生的偏见翻转约为被解决的5倍。

04:00
arXiv cs.LG

对称正定流形上函数型数据的几何特征学习

提出MatFAE,从对称正定流形函数轨迹中学习动态表征,兼具可解释性,并用于fMRI分析。

04:00
arXiv cs.LG

求解下层非凸的双层优化,需要二阶平稳性

提出二阶平稳替代及PROBE算法,解决下层非凸双层优化,逃离鞍点且有限时间收敛,实验优于SOTA。

04:00
arXiv cs.CV

何处与何时强制:面向流式虚拟人的路由式强制

按语义区域与噪声阶段路由蒸馏,人物/高噪用DFD,嘴部/背景/低噪用DMD,提升动态多样性并保质量。

04:00
arXiv cs.CV

自监督感知可解释的单目深度估计

提出自监督框架PIMDE,分解图像为感知特征图并分支估计、融合,KITTI上兼顾精度与可解释性。

04:00
arXiv cs.CL

《CG-Probes:从患者查询嵌入中恢复护栏方向》

提出CG-Probes,在冻结嵌入空间以均值差法探测三条风险轴,可媲美开源LLM且延迟极低。

04:00
arXiv cs.CV

FARE:面向诱饵替换式图像生成器检测的取证接受域估计

提出FARE,利用生成器特有伪影构建接受域,仅凭单张图像即可检测部署时生成器被暗中替换,优于基线。

04:00
arXiv cs.CV

算力用在何处:面向高效视频扩散的异构注意力

提出HetA-DiT异构注意力,按token去噪难度自适应分配算力,仅约20%token走稠密注意力,兼顾质量与效率。

04:00
arXiv cs.AI

逻辑树引导的检索增强生成用于长篇幅专利撰写

提出逻辑树引导的检索增强生成框架,以层次化逻辑树组织技术披露,实现可控且章节均衡的专利长文生成,内容质量与语言合规性优于基线。

04:00
ArXiv AI

SciHorizon-eLab:面向科学具身智能体可扩展基准测试的智能体式协议到任务编译器

提出协议到任务编译器SciHorizon-eLab,将实验协议编译为可验证具身任务,构建300项基准任务,最强策略成功率仅49.7%。

04:00
arXiv cs.LG

OpenHail:面向电动网约车车队控制的事件驱动 Gymnasium 环境

开源Gymnasium环境OpenHail,支持电动网约车车队的订单分配、调度与充电联合控制。

04:00
ArXiv AI

JevSoup:面向免训练 LoRA 组合的系统一路由

JevSoup 免训练框架分离路由与执行,仅凭输入与专家描述选两专家,正交投影等权合并,14项任务精度最高提升1.21%。

04:00
arXiv cs.CV

STORM-Bench:在演化且不完整证据下评估在线视频问答

STORM-Bench评测证据演化且不完整的在线视频问答;14个模型准确率最高60.3%,可靠性却仅5.7%–35.6%,普遍过度自信。

04:00
arXiv cs.CL

ZooWork-ShopRanker:一个开放的、偏好对齐的电商重排序器

提出0.6–8B偏好对齐电商重排序器,LLM评判标签加蒸馏,发布ShopRank-Bench。

04:00
arXiv cs.LG

PixSim:分析师容量约束下即时支付欺诈、追回与拦截的校准开源模拟器

开源校准的Pix模拟器,在分析师容量约束下模拟即时支付欺诈、追回与拦截,并评估策略。

04:00
arXiv cs.CV

PhoenixSR:生成式异构蒸馏赋能高效真实世界超分辨率模型

PhoenixSR以生成式异构蒸馏迁移扩散先验至前馈超分网络,推理无扩散开销,多骨干感知提升、保真度保持。

04:00
ArXiv AI

在网页图上训练图基础模型

提出Acacia:在网页图上从头训练,免额外训练支持任意特征与多任务,具上下文学习,不依赖LLM。

04:00
ArXiv AI

从点击到跳转:以应用原生深度链接增强移动GUI智能体

提出混合交互新范式:深度链接直航、GUI操作兜底,构建验证目录GUI-Hopper,提升真机任务成功率。

04:00
arXiv cs.LG

面向虚拟传感的神经算子节能运行

神经算子复用空间计算降低虚拟传感更新能耗,高频下省约20%,固定功耗下最高省22.5%。

04:00
ArXiv AI

LLM智能体社会中的金融脆弱性:协调失败与稳定机制

LLM智能体在金融环境中易现集体脆弱;三类承诺机制可缓解,但需早期广泛承诺方能稳定。

04:00
arXiv cs.CV

FLIP:面向视觉-语言模型的最终层推理时探测

提出FLIP最终层推理时探针,验证VLM内部干预是否支持结构化任务计算,而非一般性扰动;属验证非引导。

04:00
arXiv cs.AI

MACBT:具有纵向记忆的多智能体认知行为疗法决策支持系统

面向临床医生的MACBT多智能体CBT决策支持系统,结合纵向记忆,提升专业性与跨会话连续性。

04:00
arXiv cs.CL

LocUS:面向定向激活引导的注意力头选择与子空间投影

LocUS将激活引导限制于输出词表子空间,仅调<6%参数,能更好控制毒性、情感与谄媚且保住通用能力。