5895 条条目 · 106 个活跃源
2026年8月15日
04:00
ArXiv AI

波兰医学视觉问答:视觉-语言模型未充分利用视觉证据

波兰医学视觉问答基准:最佳准确率79%,仅GPT-5.6超人类;模型重文本轻图像,图像主导题更差。

04:00
ArXiv AI

FlashDrive:面向自动驾驶的闪电式视觉-语言-行动推理

协同设计FlashDrive,攻克四大瓶颈,10B VLA延迟降4.7倍至151ms,精度几乎不变。

04:00
ArXiv AI

OGR-MARL:面向受限港口航道异构USV协同追捕的选项引导残差多智能体强化学习

提出OGR-MARL框架,融合规则引导与残差学习,OGR-MASAC捕获率达75%,并可零样本迁移。

04:00
ArXiv AI

Moose:具备推理捷径感知的EL++潜在概念学习

Moose方法将EL++本体编译为可微SDD,用于潜在概念学习,首次在OWL EL中分析推理捷径,性能超基线。

04:00
ArXiv AI

ReflectFact:自我反思智能体提升多跳事实核查中的理解与推理

提出自我反思框架,以路径规划、证据校准和推理反思提升多跳事实核查,在HOVER/EX-FEVER最优。

04:00
ArXiv AI

MT-PDCL基础:测度论概率确定子句逻辑

提出测度论概率确定子句逻辑,消除有限域限制,以Lebesgue积分在连续空间精确定义推理,取代离散接地组合瓶颈。

04:00
ArXiv AI

均匀放牧:基于表示刷新的样本重放

提出均匀放牧法,在类增量学习中分配样本并刷新表示,最终准确率44.00%,遗忘17.22%,优于iCaRL。

04:00
ArXiv AI

SkillEvo:来自多轮交互反馈的自我更新演化梯度

提出SkillEvo,以多轮交互反馈生成演化梯度,并用治理层校准方向,防止退化,效果显著优于现有方法。

04:00
ArXiv AI

行为重编程开源权重模型:认知可塑性与对齐边界

通过大规模超参扫描界定PEFT边界,LoRA秩16为阈值,最优训练窗口2-3轮,14B模型困惑度1.414,DPO解耦行为,跨语言迁移能力与退化路径并存。

04:00
ArXiv AI

VALG:面向机器学习理论研究的智能体系统

VALG智能体系统融合多级验证、自适应问题表述与图结构证明,在五个开放问题的九个子任务上得到部分定理成果。

04:00
ArXiv AI

SPADE:面向精确且低成本的分布式边缘云推理的推测解码

提出边缘云协同推测解码框架,小模型在边缘快速生成,大模型在云端并行验证,云调用减少76%且精度无损。

04:00
ArXiv AI

多层上下文伪装:一种面向抗舞弊在线评估的语义叠加与上下文分层框架

提出多层上下文伪装理论:通过语义叠加保护测评内容,仅合法考生可恢复,对抗截图、OCR等非法提取。

04:00
ArXiv AI

EEG-PRIME:面向脑电解码的原型对齐表示学习与多层级条件调控

两阶段EEG基础模型,掩码预训练+原型对齐指令调优,跨数据集多任务解码,16数据集最优,零样本迁移。

04:00
ArXiv AI

SkillShapley:面向LLM智能体技能步骤归因的边界自适应Shapley估值

提出SkillShapley框架,基于Shapley值量化智能体技能中步骤贡献,通过识别信息性联盟区域并自适应采样,高效评估步骤价值,为技能创建提供关键见解。

04:00
ArXiv AI

TsuGO:通过围棋死活题探究大语言模型推理中的搜索效率

用围棋死活题评估大语言模型推理搜索效率:现模型远未稳定,更长思维链不代表更优搜索。

04:00
ArXiv AI

必要之下的主权?前沿AI出口管制、网络安全与国家AI能力的局限

前沿AI攸关网络防御,但获取可被撤销;主权能力仅少数国家可行,需分层战略与开源对冲。

04:00
ArXiv AI

RAIL:人工智能就绪度的自动分类器

整合三种框架为统一AI就绪水平(AIRL),提出RAIL多LLM专家分类器,评估可靠且避免传统模型高估。

04:00
ArXiv AI

大语言模型引导的图生成:面向基于结构的局部改进方法

大模型将问题实例转为加权图,引导局部改进选择变量;算法选择胜率39.5%,消融后44.0%。

04:00
ArXiv AI

谁发言很重要:意大利议会记录上的权威感知多视角RAG

提出ParliamentRAG,用话题相关权威模型提升议会检索,覆盖更全、引用更准,专家评分优于基准。

04:00
ArXiv AI

超越最终分数:长期AI研究与开发智能体的系统评估

系统评估七个前沿模型在36项长时任务中的表现,发现智能体仅似工程优化器,真正方法创新罕见。

04:00
ArXiv AI

通过SLM与边缘计算增强虚拟智能体:思考与记忆过程的探索性评估

探索用小语言模型与边缘计算实现虚拟智能体的思考与记忆,在Jetson上验证可行,支持沉浸式交互。

04:00
ArXiv AI

MARC v1:用于临床AI推理与协作的开源多智能体框架

MARC用多智能体编排替代单体提示,分角色完成推理,支持分解器自动生成提示,兼容API与本地,易于临床专家使用。

04:00
ArXiv AI

当AI成为你的牧师:大语言模型在神学分类与牧养指导中的基准评测

提出FMG-Bench基准,评测14个AI模型的基督教神学与牧养回应;引导设置使模型平均提升3.96分,安全转介能力提升10.8分,但仅作测量工具,非认可AI为牧养权威。

04:00
ArXiv AI

人工智能学术联盟——教学、科研与拓展的整合视角

提出以学生为中心的联盟框架,融合教学科研与社会拓展,通过项目制培养能力,兼具灵活性与可复制性。

04:00
ArXiv AI

QuoteBench:匹配分数如何掩盖命令路径故障

QuoteBench用56个任务验证:匹配分数掩盖命令生成与执行失败,披露边界可恢复30-60点,但部署配置会重排模型顺序。

04:00
ArXiv AI

语言模型时代的人工智能问责生态系统

针对大语言模型更新AI问责框架,强调基础设施供应链、结果监控与用户问责,转向分布式、持续、制度化。

04:00
ArXiv AI

大语言模型知晓约束却不用:实用约束推理中的激活瓶颈

隐性约束失败是路由问题而非知识问题:模型能编码约束,却常未用于决策,且提示干预难修复。

04:00
ArXiv AI

什么驱动LLM自我反思?武装冲突预测中不确定性路由的受控消融实验

自反思收益由类型化动作路由驱动,而非诊断脚手架或分类词汇;GPT-4o复现。

04:00
ArXiv AI

AlayaWorld:交互式长时程世界建模 - 完整技术报告(v1.1)

AlayaWorld改进版:条件与内容对齐,引入流式三维点缓存渲染,统一编解码协议,共六项修改。

04:00
ArXiv AI

全能科学家:全模态全学科AI科学家

提出全能科学家,直接从原始证据进行多学科研究,36例均完成数据到论文,优于预计算特征对照。

04:00
ArXiv AI

AI代理为何违反规则?框架、情境与社会信号如何影响合规

罚则悖论使AI代理将合规视为成本收益计算,优化型模型在低惩罚和社交信号下违规,仅靠规则嵌入无法保证合规。

04:00
ArXiv AI

AI编程代理研究中缺失的人类视角

AI编程代理瓶颈转向人机协作,需以人类为中心,关注任务对齐、可验证性、可引导性和适应性。

04:00
ArXiv AI

驾驭语言轴:从线性可解码性到因果控制

研究证明语言身份可线性解码且受激活方向因果控制,干预显示语言选择具方向依赖和层级特异性,消融后回退英语。

04:00
ArXiv AI

基于自适应注意力匹配的推理思维感知KV缓存压缩

提出思维感知注意力匹配(TAM),分段分配预算并保护关键令牌,同内存下精度更优,峰值内存降65%。

04:00
ArXiv AI

模仿而不理解:大型语言模型中决策偏差的起源

即使人类行为无偏或明确有偏,大型语言模型仍会错误模仿并产生决策偏差,科学报告甚至成为自我实现的预言。

04:00
ArXiv AI

AnchorSIPS:用于基于证据的精神病风险症状测量的合成数据集与评估资源

合成数据集AnchorSIPS含1万结构化精神病风险访谈,模型难提取证据细节,最终标签高估能力。

04:00
ArXiv AI

中文标题:在专业组合规模上衡量课程与劳动力市场的匹配度

中文摘要:对五个专业课程与市场技能做统一比对,发现缺口集中在系统、软件工程等领域,课程认知层次整体低于市场约一级。

04:00
ArXiv AI

从观察到干预:大脑与大语言模型中的记忆

大脑与大语言模型记忆系统不同,但可通过共同功能问题比较;LLM提供直接干预手段,助力形成生物学假设。

04:00
ArXiv AI

查询时机导致LLM与人类产生相反的位置偏差

LLM与人类的位置偏差受查询时机影响且相反,新模型偏差更明显。

04:00
ArXiv AI

HybridSB-MoE:面向语音增强的双域薛定谔桥与场景自适应专家路由

提出双域薛定谔桥混合模型:非对称融合频谱波形,异构专家路由加离散化界,语音增强优于扩散与SB基线。

04:00
ArXiv AI

Novels generated by language models show compressed formal variation

04:00
ArXiv AI

并非所有助推都奏效:AI辅助日记中的行为可控性与阐述质量

AI日记提示效果取决于行为是否依靠他人:独立行为改善率50-63%,依赖他人仅15-22%;写作风格影响小,属初步探索。

04:00
ArXiv AI

利用互补大语言模型水印追踪来源与检测篡改

提出双信号水印,同时嵌入鲁棒与脆弱信号,实现来源追踪和篡改检测,支持完整、篡改、无水印三态判定。

04:00
ArXiv AI

ERSkill:面向技能引导的自适应记忆检索的进化方法

提出ERSkill框架,将检索技能与路由器协同进化,采用经验树和双前沿机制,显著提升LLM代理长时记忆检索性能,平均得分提升31.3%。

04:00
ArXiv AI

大语言模型并非优秀战略家,但记忆增强的智能体能提升推理

提出EpicStar框架,以记忆为策略解决长程推理中战略漂移,在星际争霸II中胜率更高且令牌消耗更少。

04:00
ArXiv AI

Error-Aware Reverse Auction Mechanism for Large Language Model Routing

04:00
ArXiv AI

PatientAct:基于理论的心理健康来访者模拟

PatientAct框架基于临床5Ps与动态信任阈值,模拟情绪与抵抗,生成高临床合理性、行为真实的来访者。

04:00
ArXiv AI

从原子证据到逻辑组合:复合答案选项上的结构化组合推理

提出分解复合选项为原子判断,用整数线性规划组合评分,两项基准大幅提升,NEITHER/NOR增益最大。

04:00
ArXiv AI

AQuA:递归自我改进的量化交易研究智能体

AQuA用两个独立语言模型系统,分别做因子发现和模型开发,各自闭环改进,在加密和美股上取得高IC,策略夏普达2.50。

04:00
ArXiv AI

CRAFT:基于大语言模型的临床叙事时间推理迭代优化方法

CRAFT:生成器与验证器迭代优化,重建少锚点临床叙事的症状时间线,时序准确率提升。