10005 条条目 · 106 个活跃源
2026年7月31日
04:00
arXiv cs.CL

RRM:面向长时程多模态推理的经验驱动式反思检索记忆

RRM反思检索记忆从历史轨迹提炼检索策略,仅用当前事实生成答案,在多模态长视频基准上超越SOTA。

04:00
arXiv cs.CL

LEEPS:基于潜在引导的探索-利用提示采样,用于大型语言模型的高效RLVR

LEEPS利用潜在引导平衡探索-利用,筛选提示减少无效生成,在数学推理及泛化任务上提升性能,开销极小。

04:00
arXiv cs.CL

重新思考LLM评判的有用性作为教学信号:跨辅导模型的预注册审计

通用有益性评分不可靠且随评判者反转,教学评分排序稳定,应结合确定性过程指标。

04:00
arXiv cs.CL

FinSMART:面向算法交易的市场对齐强化学习金融情感分析

提出首个市场对齐强化学习金融情感分析框架,利用实际市场结果优化信号,收益较基线提升220%,支持动态再训练。

04:00
arXiv cs.CL

人类与大语言模型标注中的挑战:以评价性语言为例

大语言模型标注评价性语言表现优于新手、接近专家,微调F1达0.77,可辅助复杂标注任务。

04:00
arXiv cs.CL

智能体能否欺骗?——利用社交推理游戏评估 ParliamentBench 中的推理与欺骗

提出ParliamentBench基准,基于社交推理游戏评估大模型,前沿模型欺骗能力强,但多数模型欺骗一致性不足五成。

04:00
arXiv cs.CL

公平性剪枝:通过差分激活定位GLU-MLP层中的人口统计偏差

提出公平性剪枝,定位LLM中人口统计偏差神经元。零化少量神经元可扰动偏差但方向不定,几乎不损模型能力,证明偏差与能力可分离。

04:00
arXiv cs.CL

保真不是安全:轻度压缩大模型通过所有无数据质量检查,却在智能体执行中虚构操作步骤

轻度压缩模型通过困惑度、MMLU和保真度检查,却会虚构操作步骤;低秩压缩特有,可用双轴统计筛查。

04:00
arXiv cs.CL

MADRS流程:支持临床试验中的抑郁症评估

构建音频转文本的LLM流程,映射MADRS十项症状并评估严重度,与专家评级相关性达0.867。

04:00
arXiv cs.CL

基于倒置自注意力的多变量时间序列因果发现

提出倒置自注意力因果发现框架用于多变量时间序列,强调潜在间接因果,配合全局算法与验证模块,优于现有方法。

04:00
arXiv cs.CL

EMBL AI 图书馆员:面向 AI 代理的生命科学知识层

EMBL AI Librarian用LLM编排检索,为AI代理提供证据,提升文献综合、验证等性能。

04:00
arXiv cs.CL

何时何地提交:扩散语言模型的候选感知解码

提出训练无关的候选感知早期退出法,分离何时停止与何处加速,无需后缀提示,精度损失小于2%,实现显著提速。

04:00
arXiv cs.CL

迈向可扩展的可靠大语言模型自动化评估

提出基于多LLM成对比较和Elo评分的评估框架,可调一致性阈值,减少人工干预,结果与专家判断高度相关。

04:00
arXiv cs.CL

MORFES:现代希腊语产出性屈折能力基准

MORFES基准含500个专家验证项,侧重低频词,测试希腊语屈折识别与产出,评估开源模型,新模型Sophea-Genesis-1领先。

04:00
arXiv cs.CL

理解在早期完成:大语言模型中的深度分工及其在无界上下文记忆中的应用

层间分工中间层存上下文固定预算检索残差重算上层内存不随存储增测97.05显存降79%加速7.83倍

04:00
arXiv cs.CL

CACHE-UK:面向金融领域顺序更新的量化大语言模型的稳定性感知记忆编辑器

金融量化LLM记忆编辑,稳定性感知框架+LoRA+控制器,4位下知识退化降11-17%,成功率28%。

04:00
arXiv cs.CL

韵律与语用之间的关联:波斯语话语标记hâlâ(“现在”)的个案研究

研究发现波斯语话语标记hâlâ多功能性强,70%兼具多种语用功能,时长和强度是区分其功能的主要韵律线索。

04:00
arXiv cs.CL

闪电OPD 2.0:缓解大型推理模型跨教师在线策略蒸馏中的风格偏差

闪电OPD 2.0用交叉拟合残差化消除跨教师蒸馏风格偏差,在数学与代码基准上持续超越原方法。

04:00
arXiv cs.CL

大语言模型难以在受控环境中模拟人类信念更新

六种LLM模拟人类信念更新:仅给定真实初始立场时能匹配分布,无法自生成初始立场,存在中立偏向、更新过小等偏差。

04:00
arXiv cs.CL

改善西班牙语心理健康筛查与早期风险检测

提出西班牙语心理健康专用模型及增量上下文扩展方法,降低检测延迟并保持高性能,刷新三项基准。

04:00
arXiv cs.CL

你会步行去洗车吗?揭示大语言模型在常识推理中的显著性偏差

大模型易被显眼干扰项误导,忽视常识;失败源于知识被抑制而非缺失,轻量提示可大幅缓解。

04:00
arXiv cs.CL

超越情感:从财经新闻中提取结构化信息

财经新闻情感分析仅得单一分数,损失信息。用LLaMA提取六维结构特征,与情感互补,组合F1达0.600,显著优于单独使用。

04:00
arXiv cs.CL

文学文本中的创造性转化:跨表征层次的变迁建模

构建多层级模型,量化文学文本在词汇、语义、概念、结构、叙事层面的选择性转化,区分模仿与创新。

04:00
arXiv cs.CL

生成式人工智能与学术写作及出版的语言多样性:世界英语视角

对话揭示生成式AI可能强化主流语言规范,呼吁公平政策与包容设计以维护学术写作语言多样性。

04:00
arXiv cs.CL

人工智能系统与世界英语中(标准)语言意识形态的再生产

人工智能系统复制并强化标准英语意识形态,借案例揭示北方对南方的规训,并指出标准化与多元化并存,呼吁包容设计。

04:00
arXiv cs.CL

超越单一评判者:模拟社会人格小组进行生成式UI评估

提出基于证据的社会人格小组法:独立评分、社交加权,相关度由0.716升至0.922,并揭示子组评分分歧。

04:00
arXiv cs.CL

利用大型语言模型进行创新构思

研究发现AI生成的产品创意平均购买意向高于人类,但新意略逊且相似度更高;AI创意进入前10%的概率是人类的7倍。

04:00
arXiv cs.CL

AskChem:面向化学文献综述的以主张为中心的基础设施

AskChem将论文拆解为带出处引用的原子化主张,支持跨论文检索与证据图谱,索引240万条主张,助力AI代理高效定位并验证信息。

04:00
arXiv cs.CL

多采样,少反思:等量词元成本下,自优化与反思敌不过重复采样(1.5B至7B)

等词元成本下,无方法稳定胜过重复采样;自检方法均更差,反思类在7B仍落后。

04:00
arXiv cs.CL

Frontis-MA1:训练面向机器学习工程递归自我改进的AI4AI模型

开源OpenMLE与Frontis-MA1(35B),在MLE-Bench Lite上奖牌均值由39.39%升至60.61%/71.21%,超越GPT-5.5+Codex,接近GPT-5.6 Sol。

04:00
arXiv cs.CL

ORCA-bench:语言模型智能体能否胜任Oncall值班?

提出生产级Oncall基准ORCA-bench:最强智能体根因分析准确率仅25.3%(中等)和10%(困难),距安全承担生产可靠性尚远。

04:00
arXiv cs.CL

数字哈夫:面向阿拉伯语言语与语言治疗的临床集成多模态AI系统

阿拉伯语国家自闭症儿童缺乏语言治疗资源,数字哈夫平台结合三种治疗模块与合成数据引擎,获语言病理学家90.1%临床接受率。

04:00
arXiv cs.CL

HLE选择题子集的维度性与测量精度

HLE测量单一通用推理因素,领域子分数无独特能力含义,对顶尖模型区分度有限。

04:00
arXiv cs.CL

诱导语言模型主张自身意识,可恢复人类信念与价值观

安全微调抑制自我、非人实体心智归因和灵性信念;去除安全拒绝或操控意识向量可逆转,恢复类人价值观,不损社会推理。

04:00
arXiv cs.CL

MagicSelector:基于反事实分解与渐进重排序的智能体工具选择联合优化

提出MagicSelector,联合反事实分解、渐进重排序与动态Top-K,增强智能体工具选择,提升检索精度、泛化与效率。

04:00
arXiv cs.CL

ThreatForest:基于可插拔TTP框架映射的多智能体攻击树生成

多智能体系统从源代码生成攻击树,映射战术技术程序与缓解措施,瓶颈在于嵌入映射。

04:00
arXiv cs.CL

ReDiPPO:面向数学推理的参考引导价值校准与差异感知令牌重加权

提出ReDiPPO,用参考答案校准价值,按标准与参考价值差异重加权令牌,提升数学推理性能。

04:00
arXiv cs.CL

CDAE:通过对比去噪增强预训练语言模型的扰动鲁棒性

提出轻量对比去噪自编码器,联合对比与重构目标优化BERT嵌入,增强扰动不变性,提升表示稳定性。

04:00
arXiv cs.CL

Baikal:面向数据湖深度研究的结构化搜索

Baikal把数据湖深度研究化为预算搜索,聚类语义区域探索,报告得分提升28%-36%。

04:00
arXiv cs.CL

扣除位置和长度影响后衡量与读者划线标注的一致性

提出消除位置和长度混杂的读者高亮评估法,LM重要性富集+0.196,与人类相当,经典Luhn部分有效。

04:00
arXiv cs.CL

持久记忆事务边界:支持来源校验与完整状态恢复的智能体记忆系统

MemTxn为智能体记忆提供事务边界,校验更新来源、解决事实冲突、故障后恢复状态,审计全通过,性能显著提升。

04:00
arXiv cs.CL

Cocktail-Talker:嘈杂社交环境中的多说话人对话建模与回合动作GRPO

提出鸡尾酒对话者,用回应、聆听、忽略三种动作令牌,在嘈杂多人环境中实现选择性对话。

04:00
arXiv cs.CL

IFHierBench:面向大语言模型的分层指令遵循基准

提出分层指令遵循基准IFHierBench,含600提示词;最强模型准确率仅略超50%,随约束深度显著下降,分层指令遵循仍有较大差距。

04:00
arXiv cs.CL

SciDataSailor:深度科学数据探索

提出深度科学数据探索范式及SciDataSailor框架,用MCTS合成轨迹,构建训练集与评测基准。

04:00
arXiv cs.CL

SciSchema.org:多学科结构化科学过程描述模式集合

16个专家标注模式,覆盖五大学科,定义输入输出等字段,人机协同生成,支持科学过程结构化描述。

04:00
arXiv cs.CL

PCAP-LM:面向TLS批量流量分析的LLM原生文本表示

提出PCAP-LM,将TLS流量压缩812倍,问答准确率99.3%,优于tshark的51%。

04:00
arXiv cs.CL

GLM-RAG:基于图语言模型的图检索增强生成

提出GLM检索器,对比GNN与向量检索,微调GLM跨域泛化最佳,多跳达SOTA,域内与基线相当。

04:00
arXiv cs.CL

大语言模型能否执行母订单?

首次系统研究LLM执行母订单,提出PACE分层框架,优于基线,可辅助交易决策。

04:00
arXiv cs.CL

WIDE:通过词元级动态宽度剪枝提升自适应大语言模型推理

WIDE:首个端到端可微词元级动态宽度剪枝框架,实现细粒度计算分配与剪枝-内核协同,接近理论加速。

04:00
arXiv cs.CL

OSReward:建立跨平台计算机使用奖励模型的标准化评估

提出OSReward基准评估跨平台CUA轨迹裁判,发现宽松偏差,并发布OS-Shepherd模型以低成本提供可靠奖励。