61581 条条目 · 106 个活跃源
2026年9月29日
04:00
arXiv cs.CL

语言模型中的角色人设效应能泛化多远?

人设效应可预测却难迁移:跨模型/提示需目标校准,正则更新更优,源关系须有增量价值。

04:00
arXiv cs.AI

授权闭包图:面向指令持续演化的LLM智能体最小修复

提出授权闭包图框架,将授权依赖建模为可版本化状态,仅失效受影响部分并最小修复,提升安全与任务成功率。

04:00
arXiv cs.AI

MergeHEIR:缓解作为模型合并代价的多模态幻觉

模型合并会加重多模态幻觉;MergeHEIR 以 SVD 构建逐层零空间投影,约束合并后更新,兼顾幻觉缓解与专家能力保留。

04:00
arXiv cs.LG

面向信用卡欺诈检测的注意力驱动异构图神经网络模型

采用SMOTE-Tomek平衡数据,结合注意力异构图神经网络检测信用卡欺诈,准确率达99.97%。

04:00
arXiv cs.LG

SAMBAR:通过乘子法进行选择性锚定,以在视觉-语言-动作模型中平衡知识获取与保持

提出SAMBAR,无需旧任务演示,以乘子法和选择性锚定平衡VLA持续学习中的新知获取与旧识保持,避免灾难性遗忘。

04:00
ArXiv AI

打开 LLM 评判器:超越最终裁决恢复偏好信号

LLM评判器常判错,但内部激活仍编码正确偏好;探针可恢复信号,表面线索越强收益越大,并助发现错误。

04:00
arXiv cs.CL

C-HAT-Bench:超越完全生成文本的中文AI文本检测基准

中文人机协作文本检测基准含5千源文本、24万变体,21个检测器在协作模式下AUROC平均降12%。

04:00
arXiv cs.CV

使用混合量子机器学习的人脸分类

8量子比特混合量子分类器用于人脸识别,CPU上准确率与训练效率超FaceNet,推理0.2–0.5秒。

04:00
ArXiv AI

功能重于形式:带副本专家机制的混合专家模型中的分布正交化

提出分布正交化损失和副本专家机制,防止专家崩溃、优化负载均衡,在MoE模型上性能更优且训练效率相当。

04:00
arXiv cs.AI

超越脚本化搜索:基于智能体黑盒优化的样本高效奖励发现

LLM智能体基于评测历史动态构建搜索策略,在共享预算下高效发现控制任务奖励函数。

04:00
arXiv cs.CV

视觉语言预训练粒度重要吗?跨胸部X光解读任务的视觉语言目标受控评估

固定编码器与数据比较九种目标,发现预训练粒度与任务粒度在极端处对齐,无单一目标普适最优。

04:00
arXiv cs.CL

ExpVoyager:面向动态智能体技能合成的直接经验导航

技能合成重构为经验动态导航,管理者按需多视角探索轨迹,边提取可复用知识边追踪剩余需求,提升下游表现。

04:00
arXiv cs.CV

TriO:面向万物感知的三模态无监督占用世界模型

三模态自监督世界模型,无需标注,预测4D占用、分割与流,零样本道路障碍分割达SOTA。

04:00
arXiv cs.CL

聚焦条件:推理时自对比引导让LLM获得更优条件文本嵌入

提出推理时自对比引导SCS,以无条件嵌入精炼条件嵌入,免训练即插即用,提升LLM条件文本嵌入质量。

04:00
arXiv cs.LG

CAFE:基于快速后验估计的反事实预测

提出CAFE摊销推断框架,用预训练Transformer单次前向传播逼近贝叶斯反事实后验预测分布,兼顾因果结构不确定性,在可识别、不可识别及实际场景均稳健。

04:00
arXiv cs.CV

媒介可见性的双刃剑:视觉框架如何削弱女国会议员的胜任力感知

视觉框架影响女国会议员胜任力:分屏降低其胜任力,愤怒语言更损温暖,单独出镜或提升女性观众政治效能。

04:00
arXiv cs.CL

MixDetect:AI编辑的词级定位与量化

MixDetect实现AI编辑词级定位与量化,分别预测各词是否被编辑及强度,揭示编辑范围与强度模式。

04:00
arXiv cs.LG

智能手机运动传感器在未见用户与手机机型间的手写数字泄露

传感器可跨未见用户与机型预测手写数字,准确率57.74%,但隐私解读受采集顺序捷径限制。

04:00
arXiv cs.AI

PrismQuant:面向分组量化器的最优零空间旋转

提出量化器感知旋转框架,将激活主特征子空间对齐分组INT4常量子空间,闭式最优,70B模型量化性能接近全精度。

04:00
arXiv cs.LG

面向全局采样的并行拆分学习中的延迟感知客户端分配

提出延迟预算并行拆分学习,用流规划与贪心分配客户端,CIFAR-10建模时间减6.75%,精度降0.30个百分点。

04:00
arXiv cs.CL

论大语言模型智能体的行为特质

提出A-B-D法,从34万余条轨迹自下而上推断智能体特质,得六因子,揭示知识与行为差距。

04:00
arXiv cs.LG

REALM:区制切换、可解释且由激活诱导的线性模型

提出REALM:以神经网络激活模式划分区制,每区制拟合线性模型,并用可解释门控复现区制分配。

04:00
arXiv cs.CL

OpenTumorBoard:多学科肿瘤委员会讨论轨迹的真实世界基准

从611例、1.9万轮真实肿瘤委员会讨论构建基准,评测14个大模型,最佳仅3.43/5,微调可提升。

04:00
arXiv cs.CV

面向视觉指针式仪表读数的类型均衡联邦学习

提出类型均衡联邦框架,多站点不共享原图协同训练,四阶段完成指针表读数,并发布MeterFL数据集。

04:00
arXiv cs.LG

谱反转:对抗图提示中的奇异值偏置

揭示预训练GNN的谱偏置现象,提出谱反转提示SRP,在谱域重平衡奇异值并增强零空间,实现参数高效适应

04:00
arXiv cs.CV

CueKFS:面向长视频理解的智能体线索驱动关键帧选择

免训练CueKFS将问题与帧匹配转为动态视觉线索比较,智能体修订线索重探索视频,多基准长视频问答达最优。

04:00
arXiv cs.CL

ARSM:面向智能体推理压缩的自回归状态机

ARSM是免训练自回归状态机框架,借HAR微链与动态状态机压缩推理历史,保性能并降token消耗。

04:00
arXiv cs.CL

从知到弃答:弥合视觉语言模型中的表征—行动鸿沟

提出VAD-R基准与Rep2Act,将视觉语言模型潜在可答性转为弃答决策,显著提升拒答性能。

04:00
arXiv cs.CV

长尾人体数据整理的质量过滤器审计

低姿态工人稀少,更常被质量过滤剔除和检测器漏检,长尾人体数据整理不宜依赖边界框或姿态。

04:00
arXiv cs.LG

我们该冻结什么?守护式冻结:连接性塑造预训练模型的微调

仅冻结权重难保性能;提出守护式冻结:按输入连通性选策略,可切断用移除值,仍连通用漂移值,保旧任务性能。

04:00
arXiv cs.CV

基于强化学习增强胸片报告生成中的视觉推理

提出整合解剖区域和事实奖励的强化学习框架,提升胸片报告生成的视觉推理与可解释性。

04:00
arXiv cs.LG

达到标准杆:面向可证明最优四边形块分解的强化学习

强化学习智能体局部编辑网格,建四边形分解并达顶点不规则度拓扑下界,实现可证明最优,远超Gmsh。

04:00
arXiv cs.CV

PredRA:通过确定性成分提取与受控随机细化实现快速医学图像转换

PredRA以确定性预测为参考,受控随机细化残差,参数更少、采样更快地实现高保真医学图像转换。

04:00
arXiv cs.LG

少测量下稀疏线性分类器混合模型的高效支撑集恢复

提出自适应与非自适应方案,减少测量次数并实现亚线性解码,改进混合模型支撑集恢复效率。

04:00
arXiv cs.CL

无需预训练文本嵌入的主导时间取向分类:一种新颖的形态句法清单向量方法

提出“形态句法元”清单向量编码句子,无需预训练嵌入,在1799个复杂句上三分类准确率达92%。

04:00
ArXiv AI

RepoMAS:用Issue驱动的多智能体系统求解渐进式指定任务

提出ProgSpec基准与Issue驱动的RepoMAS框架,可在执行中修订任务规范,于六项基准上达最佳性能。

04:00
arXiv cs.CV

ScreenHaystack:在GUI元素定位中寻找盲区

提出ScreenHaystack基准,发现主流GUI定位模型存在空间盲区且可迁移至未见样本;盲区源于训练数据覆盖不均,盲区导向增强可提升精度。

04:00
ArXiv AI

从潜表示到线路:大语言模型的外科式后编辑

L2W借J-lens定位与反例引导因果裁剪,精准后编辑大模型,移除指定语义目标且保留其他能力。

04:00
arXiv cs.CL

滞留与丧失:低比特语言模型中的知识崩塌

低比特三元模型训练中知识容量先升后崩,仅存fp16的6%;根因是输出头学习率滞留不稳定,改进调度可恢复。

04:00
arXiv cs.CL

无需权衡地提升大语言模型输出多样性

提出DAST,通过重排词元使语义相近者连续并结合算术采样,在不改变分布、近零开销下提升LLM输出多样性,ProtoQA显著提升。

04:00
arXiv cs.LG

基于模拟器集成的不确定性感知在线算法选择

不确定性感知选择基于模拟器集成,缓解离线数据有限问题;多臂老虎机理论遗憾更优,提升机器人控制在线表现。

04:00
arXiv cs.LG

图上的解析游走旋转位置编码

提出AW-RoPE,将旋转置于边并在所有游走上求和,能区分不同路径;精确版与稀疏版在多个基准上提升15–58%。

04:00
arXiv cs.AI

PULSE:利用稀疏自编码器识别演示效用特征

PULSE借助稀疏自编码器定位示例效用的模型内部特征并用于选例,在分类、生成、推理上均超越强基线。

04:00
arXiv cs.CV

ControlGS:面向下游处理感知的XR渲染的神经高斯条件化

将XR渲染到人眼间的下游处理纳入优化,按运行时参数动态生成高斯原语,端到端提升XR画质且开销极小。

04:00
arXiv cs.CV

Depth Any Seen:哪些表面,距离多远?

Depth Any Seen用多伯努利深度集与ExactMB,联合估计可见表面及度量深度,显著减少过预测。

04:00
arXiv cs.CL

TCMQA:一个含3.8万道题目的中医基准,附执业医师作答参考

TCMQA含3.8万道中医考题与101位医师作答,评测29个模型:预训练语料比规模更能预测中医能力。

04:00
arXiv cs.LG

重新思考时间序列预测中的跨通道重要性

跨通道重要性≠相关≠有用≠被用;依赖随预测步长变化,自适应选源有增益,但神经模型迁移有限。

04:00
ArXiv AI

VPEvolve:面向计算光刻的自进化虚拟工艺工程师

VPEvolve结合虚拟工艺工程师与技能库,用冻结语言模型自进化优化OPC配方,将Poly/Metal1最大边缘放置误差降至5.36/15.69nm。

04:00
arXiv cs.AI

ForkLeft:面向前缀对齐的自回归到扩散蒸馏的熵优先展开

ForkLeft用熵优先展开对齐前缀并蒸馏自回归教师,让扩散模型保留并行生成且获得推理能力。

04:00
arXiv cs.CL

OneSign:用一个模型统一手语理解任务

OneSign统一框架,单个模型完成手语识别与翻译,并用模态自适应混合专家弥合手语与文本模态差异。