9995 条条目 · 106 个活跃源
2026年7月31日
04:00
arXiv cs.CL

AI辅助开源软件提交预审:BOSC 2026经验报告

BOSC 2026用AI预审摘要六项标准,并容器化测试可运行性;评审者认为有用,但需人工核对。

04:00
arXiv cs.CL

选择零样本意图分类的开源权重语言模型:对41个模型的系统评估

系统评估41个开源模型,3B指令微调可超7B基座,主流基准已饱和,需关注校准与部署效率。

04:00
arXiv cs.CL

实践中的提示链:自动化学术报告生成的案例研究

提出多阶段提示链方法,用于自动化学术报告生成,成功率100%,ROUGE-L分数优于单次提示。

04:00
arXiv cs.CL

共情框架:评估跨社会人口群体的AI对齐

评估LLM对新闻框架的情感对齐,发现模型间差异大,领先模型整体对齐但各群体间存在显著差异。

04:00
arXiv cs.CL

BridgeAlign:架接人文社科领域的偏好对齐

提出BridgeAlign,三阶段偏好对齐管线,经21万样本训练,使Qwen3-8B在17项基准上平均最优,兼顾人类偏好与知识能力,无权衡。

04:00
arXiv cs.CL

LayerRAG-Bench:智能体检索增强生成的跨层可靠性基准

提出跨层可靠性基准,揭示仅靠模式规范化或证据性评估无法全面修复各层故障。

04:00
arXiv cs.CL

HSS-Synth:面向大语言模型的人文与社会科学数据合成

提出HSS-Synth人文社科数据合成流水线,生成23.7万高质量指令样本,微调Qwen3-8B超越14个基线,达到新SOTA。

04:00
arXiv cs.CL

相同事实,不同诊断:临床语言模型中叙事锚定的测量与缓解

临床语言模型存在叙事锚定:相同事实不同表述致诊断分歧。NarrativeShield可将其降至近零。

04:00
arXiv cs.CL

AHA-Memes:面向阿拉伯语表情包中仇恨理解的细粒度多模态基准

首个大规模阿拉伯语仇恨表情包基准:含5K细粒度标注与66K银标,评测多种模型并开放数据。

04:00
arXiv cs.CL

大语言模型在概率算子上的逻辑推理能力基准测试

提出概率算子推理基准(1.4万提示/15模板),测29模型:多数有独立于逻辑形式的是/否偏好,仅9个优于随机。

04:00
arXiv cs.CL

ICLE++:面向整体作文评分的细粒度特征建模

介绍带整体与特质评分的ICLE++语料库,用于测试AES模型泛化性及支持多特质、跨提示评分。

04:00
arXiv cs.CL

SkillSmith:学习组合参数化技能与文本知识

将模型权重视为额外模态,结合文本与参数技能,SkillSmith通过前缀调整实现指令引导的参数合成,显著提升性能。

04:00
arXiv cs.CL

通用型与专家型大语言模型社交网络中的信念协同演化

专家型LLM使共识偏移翻倍并引发影响力不对称;异质群体模拟需多种底层模型,而非仅角色提示。

04:00
arXiv cs.CL

自监督语义扩散:像训练参数一样训练技能

无监督自演化框架借鉴扩散模型损坏-重建范式,用人类作品作自监督信号,自动提取技能提升专业生成能力。

04:00
arXiv cs.CL

超越相似性:中国古典史籍互文性的智能体锚定抽取与专家裁定评估

将互文性抽取转为智能体任务,锚定字符跨度并五维标注;专家裁定基准评估十二模型,扩展至二十四史揭示结构。

04:00
arXiv cs.CL

可审计知识引导AI系统AWARE-FX,用于衡量企业外汇对冲披露

AWARE-FX是可审计AI系统,将年报文本转为可追溯的对冲披露指标,香港24,909公司年验证,表现稳健,严格分数与外汇敞口负相关。

04:00
arXiv cs.CL

Harness-G:面向搜索代理的图结构检索框架

提出图结构检索框架Harness-G,将查询生成转为有限动作选择,解决检索别名坍塌,在六项QA基准上平均F1大幅领先。

04:00
arXiv cs.CL

从单文档到跨文档:大语言模型多粒度事件分析的基准测试

提出多粒度事件分析基准MiGUE-Bench,含四任务,揭示LLM在跨文档事件分析中的不足。

04:00
arXiv cs.CL

DualAnchor:在无词表手语翻译中保留语言先验并提升词汇保真度

提出DualAnchor框架,通过词级先验锚定和最优传输对齐,保留语言先验并提升词汇保真度,在基准上表现优异。

04:00
arXiv cs.CL

极简RAG模型:B1ade 335M嵌入与1B参数小语言模型

极简RAG:335M嵌入零训练居首,1B模型经强化学习涌现引用归因,无需显式监督,端到端较微调提升10.8%

04:00
arXiv cs.CL

ChronoMem:面向大语言模型智能体记忆的版本控制与语义回滚

ChronoMem为LLM智能体记忆提供语义版本控制与回滚,支持自然语言撤销,显著提升回滚后问答与摘要一致性。

04:00
arXiv cs.CL

先召回再排序:基于相似性引导的Top-K复用实现高效长上下文注意力

提出ReTopK:复用相似查询的历史检索结果,以极少精度损失加速长上下文Top-K稀疏注意力。

04:00
arXiv cs.CL

LVLMs能否揭示视觉错觉背后的真相?感知与推理能力分析

提出用视觉错觉评估LVLMs,构建基准,发现其推理能力不如所声称的先进。

04:00
arXiv cs.CL

超越情绪好转:能力维持型情感对话的纵向研究范式

提出能力维持型情感对话(CSED)纵向范式;审计显示95%研究仅求缓解,无一评估能力。

04:00
arXiv cs.CL

全局稀疏一瞥:免训练自推测解码

提出免训练自推测解码框架,稀疏化可召回键值缓存与熵控推测长度,实现长上下文加速且保持输出分布。

04:00
arXiv cs.CL

推理共识:基于加权DAG聚合的LLM推理结构集成

提出加权DAG聚合多模型推理链的共识推理框架,优于多数投票基线,并生成可检查的共识推理图。

04:00
arXiv cs.CL

多模态情感分析的语义对齐结构抽象

提出SentiLLM框架,用语义对齐结构抽象将非语言信号蒸馏为紧凑词元,双流校准建模情感变化,MSA效果优异。

04:00
arXiv cs.CL

超越借用历史:面向交互式角色扮演评估的个体对齐用户模拟

针对固定历史与评分标准之弊,提出PALATE:用个性化用户模拟器评估角色扮演,生成可解释的用户级评价。

04:00
arXiv cs.CL

自动监督:用有依据的修订验证实现科学工作流反馈闭环

自动监督利用同行评审记录评估稿件修订是否解决审稿关切,在5.6万篇论文上实验发现证据验证仍是瓶颈,最佳模型仅0.501。

04:00
arXiv cs.CL

用于设备端上下文学习的无梯度任务条件检索

CoRA无梯度,闭式岭回归对齐候选表示到任务条件空间,低秩基支持查询仅输入,离线索引,无需微调。

04:00
arXiv cs.CL

大规模记忆解码器:一种预训练的参数化长期记忆

将记忆模块扩至69亿参数,独立扩展预训练记忆比扩大基座模型更高效,以更少参数超越更大模型。

04:00
arXiv cs.CL

RepBench:将基准编译为大型语言模型的能力表示

RepBench构建能力基准数据层,覆盖94项能力,跨基准评估揭示读出方法与聚合标准影响显著。

04:00
arXiv cs.CL

FinanceHarness:自主金融深度研究框架

提出金融深度研究框架FinanceHarness与基准FinanceGym,专家验证通过率82%,顶尖模型低于40%,框架提升至32.4%

04:00
arXiv cs.CL

GGC:面向可靠文本到SPARQL生成的选择性查询纠正

提出生成-门控-纠正框架,仅对高风险查询进行纠正,将查询准确率从90.23%提升至98.33%,同时减少45%推理开销。

04:00
arXiv cs.CL

RRM:面向长时程多模态推理的经验驱动式反思检索记忆

RRM反思检索记忆从历史轨迹提炼检索策略,仅用当前事实生成答案,在多模态长视频基准上超越SOTA。

04:00
arXiv cs.CL

LEEPS:基于潜在引导的探索-利用提示采样,用于大型语言模型的高效RLVR

LEEPS利用潜在引导平衡探索-利用,筛选提示减少无效生成,在数学推理及泛化任务上提升性能,开销极小。

04:00
arXiv cs.CL

重新思考LLM评判的有用性作为教学信号:跨辅导模型的预注册审计

通用有益性评分不可靠且随评判者反转,教学评分排序稳定,应结合确定性过程指标。

04:00
arXiv cs.CL

FinSMART:面向算法交易的市场对齐强化学习金融情感分析

提出首个市场对齐强化学习金融情感分析框架,利用实际市场结果优化信号,收益较基线提升220%,支持动态再训练。

04:00
arXiv cs.CL

人类与大语言模型标注中的挑战:以评价性语言为例

大语言模型标注评价性语言表现优于新手、接近专家,微调F1达0.77,可辅助复杂标注任务。

04:00
arXiv cs.CL

智能体能否欺骗?——利用社交推理游戏评估 ParliamentBench 中的推理与欺骗

提出ParliamentBench基准,基于社交推理游戏评估大模型,前沿模型欺骗能力强,但多数模型欺骗一致性不足五成。

04:00
arXiv cs.CL

公平性剪枝:通过差分激活定位GLU-MLP层中的人口统计偏差

提出公平性剪枝,定位LLM中人口统计偏差神经元。零化少量神经元可扰动偏差但方向不定,几乎不损模型能力,证明偏差与能力可分离。

04:00
arXiv cs.CL

保真不是安全:轻度压缩大模型通过所有无数据质量检查,却在智能体执行中虚构操作步骤

轻度压缩模型通过困惑度、MMLU和保真度检查,却会虚构操作步骤;低秩压缩特有,可用双轴统计筛查。

04:00
arXiv cs.CL

MADRS流程:支持临床试验中的抑郁症评估

构建音频转文本的LLM流程,映射MADRS十项症状并评估严重度,与专家评级相关性达0.867。

04:00
arXiv cs.CL

基于倒置自注意力的多变量时间序列因果发现

提出倒置自注意力因果发现框架用于多变量时间序列,强调潜在间接因果,配合全局算法与验证模块,优于现有方法。