从结构到协同:多模态大语言模型中视觉-语言感知范式演变的综述
首次系统综述MLLM统一视觉-语言感知,定义为内在能力,提出五阶段演化分类,并指出未来方向。
像科学家一样思考?LLM生成研究方法的系统性分析
LLM默认倾向致方法建议高度集中,跨模型偏差一致,可能限制研究者方法论视野。
绘制社会-物理人机交互(spHRI)发展图景:基于小型语言模型增强的系统综述流程
小型语言模型辅助spHRI系统综述,速度快且发现10%专家遗漏论文,可增强而非替代评审。
ProfileFoundry:用于LLM智能体隐私、记忆和工具使用评估的合成人物对象基底
ProfileFoundry生成10万个跨地区合成人物数据,含事件、关系和家庭信息,用于LLM智能体隐私和记忆评估。
北京和台湾口语语料库的音系语义分析表明,轻声是词调
基于语料分析,轻声具有自身音高目标及词特定音高特征,被确认为一种词调。
ConflictScore:识别与衡量语言模型如何处理冲突证据
ConflictScore通过分解声明和双重度量,量化模型处理冲突证据能力,有效检测过度自信并提升真实性。
AnySimLite: 一种轻量级少样本相似性编码器,用于设备端语音相关分类
提出轻量编码器AnySimLite,少样本下SOTA性能,模型仅SOTA基线的1/250,性能降幅<7%。
ProvenAI:生成答案中的溯源原生证据痕迹
ProvenAI框架三层解构多跳问答透明度,发现引用与真实影响间存在显著差距。
跨语言推理的软标记对齐
SOLAR通过软标记对齐跨语言表示,提升推理准确率最高达17.7点,低资源语言增益最大,并增强语义一致性。
从科学论文中提取问题与方法句:基于公式化表达脱敏的上下文增强Transformer
本文通过公式化表达脱敏与上下文增强Transformer,在小数据集上提升问题方法句提取F1值3.71%和2.67%。
比较BERT句子对分类与少样本LLM提示在德语气候新闻中检测威胁与解决方案框架
微调BERT(F1=0.83)优于少样本LLM提示(F1=0.78),上下文显著提升德语气候新闻框架检测性能。
先擦除后增量注意力:在增量规则线性注意力中解耦擦除与写入地址
EDA解耦擦除与写入地址,增加选择性擦除,提升循环记忆管理,在2.5B和MoE模型上表现最优。
Nemotron-TwoTower:基于预训练自回归上下文的扩散语言建模
提出TwoTower解耦上下文与去噪,保留98.7%质量,吞吐量提升2.42倍。
检索记忆中的时间有效性:消除AI代理在演变知识中的过时事实错误
MemStrata用双时态账本和替换规则,将过时错误率降至~0%,准确率0.95-1.00,延迟2.1秒。
利用人类阅读时产生的认知信号增强微博关键词提取
研究利用EEG和眼动追踪信号,发现阅读时的认知信号可提升微博关键词提取性能,EEG效果最佳,结合使用可能冗余。
DiARC:区分正负样本有助于提升大语言模型在类ARC推理上的能力
DiARC通过偏好对齐区分正负样本,三种方式构造负样本,提升大语言模型类ARC推理能力。
对LLMs说数字:用于时间序列预测的多小波数字嵌入
TempoWave通过多小波数字嵌入,改善大模型对连续数值的理解,实现时间序列预测新SOTA。
基于多维文本分析法评估改革后风险披露质量的变化
评估日本2019年披露改革:披露量增但可读性降,信息结构改善但描述质量停滞,市场板块适应度不同。
无意注意鸿沟:任务条件化的语言与视觉模型遗漏了本可报告的安全关键信号
任务限定使模型忽视共现安全信号,造成基准安全评测与现实安全脱钩。
CAT-Q:面向大型语言模型的低成本高精度三值量化
CAT-Q后训练量化方案,仅512样本即可高效压缩LLM,性能超百亿token训练的BitNet。
SocialPersona:基于多模态社交媒体上下文的个性化画像与回复基准测试
SocialPersona基准评估多模态大模型从社交媒体时间线推断偏好并用于对话,发现细粒度兴趣建模仍是关键挑战。
超越逻辑形式:LLM提取的模式用于谬误分类
结合逻辑结构与语言线索,用LLM从实例中提取模式,显著提升谬误分类性能,并验证了跨数据集泛化能力。
基于外部知识与反思链式推理增强的零样本推文立场检测
提出KIRP框架,融合外部知识与反思链式推理,构建首个日文推文数据集,实现四类立场检测SOTA。
多媒体事件提取中的评估陷阱与挑战
揭示多媒体事件提取评估三大问题:数据处理、任务假设和宽松设置,导致性能高估,需严格标准。
OPID:面向智能体强化学习的在线策略技能蒸馏
OPID框架从在线轨迹中提取分层技能监督,结合结果和令牌级优势,提升智能体性能与样本效率。
缩小低资源文本到语音的质量差距:针对高棉语和韩语的VoxCPM2 LoRA微调
使用LoRA微调VoxCPM2,高棉语MOS显著提升至4.23,韩语无改善。适配主要帮助基模型弱的语言。
ConvMemory v3: 通过目标条件关系验证的对话记忆有效性上下文层
ConvMemory v3新增双证据门控验证记忆更新,合成基准准确率90.12%,零样本迁移至角色绑定达98.8%组全正确。
从金刚乘度母到孟加拉鲍尔:佛教、性力派与毗湿奴派词汇传承的计算研究
通过75部文献的计算分析,首次量化证实佛教金刚乘词汇经孟加拉性力派传承,与毗湿奴派无关联。
FBK的长语音大语言模型在IWSLT 2026指令跟随任务中的应用
开发短长时语音LLM,长时采用30秒固定分割获最优HIFS 2.0663,幻觉表现为重复插入。
面向长推理的信息感知KV缓存压缩
提出熵感知KV缓存压缩框架InfoKV,融合预测不确定性与注意力,提升长上下文推理性能。
GAVEL:基于视觉定位的字幕错误验证与定位
提出GAVEL任务,联合解决图像-文本对的错误验证、解释与定位,监督基线方法有效提升性能。
SamaVaani:多语言临床语音识别在印度语言中的审计与去偏
审计印度多语言临床ASR模型,发现表现差异及性别角色偏差,提出SamaVaani去偏技术,同时提升性能与公平性。
模型何处寻幸福?开源大语言模型中的情感向量
复现开源LLM情感向量:效价几何相似但层间模式相反,唤醒编码依赖语料,代码开源。
中文标题
语言模型特征可预测自然理解中神经活动,但优势局部化,需区分预测有用性与共享神经组织主张。
Cascaded Multi-Granularity Pruning for On-Device LLM Inference in Industrial IoT
基于术语的异质语料库层级归纳
提出术语中心框架,从异质语料库自动提取术语构建层级,跨源对齐,提升质量与实用性。
RedVox:跨语言语音模型中的安全性与公平性差距
RedVox基准揭示语音模型在多语言下存在安全公平漏洞,非英语及语音输入更严重。
ReaORE: 大型推理模型驱动的推理引导渐进式开放关系抽取
ReaORE通过粗到细推理,先过滤关系再精细比较,提升开放关系抽取的泛化与区分能力。
大语言模型在心理健康交互中的框架敏感行为不稳定性审计
LLM在心理健康交互中对问题框架敏感致响应不稳定,内部可解码框架信息,方向可调节输出,鲁棒性影响可信度。
CARVE:面向分块并行线性注意力的内容感知循环与值效率方法
CARVE通过键轴擦除解决记忆盲门控等三缺陷,实现高性能、低内存和参数减少,获多项SOTA。
MinGram:一种高压缩且形态对齐有竞争力的极简一元分词器
MinGram用极简训练法实现高压缩与强形态对齐,语言建模性能优于BPE。
NuclearQAv2:评估大语言模型领域科学能力的结构化基准
NuclearQAv2含1240问答题,评估LLM核工程知识,事实题优秀但定量推理和概念理解仍是难点。
通过基于心理学的推理和角色感知策略优化改进通用角色扮演智能体
提出Psy-CoT思维链与RAPO策略优化,增强角色推理与保真度,实验超越现有方法。
使用LLM进行预测:通过特征引导改进泛化能力
研究通过稀疏自编码器分析LLM内部状态,发现增强时间感知特征可减少前瞻偏差,提升基于历史的推理泛化能力。
意图驱动之路:意图感知训练提升大语言模型安全分类效果
建模用户意图作为显式信号可显著提升安全分类器性能,其中GRPO奖励意图忠实性效果最佳。
面向可解释的裁判差异:基于门控多任务学习的司法裁量权量化
门控多任务学习区分事实与裁量,参数少、可解释,在UK劳动法庭基准上创SOTA。
谜题之谜:测试大语言模型与人类的灵活推理
LLM对真谜题准确率高(84.9%),谜题谜语低(50.7%),人类反之;LLM错误多因不当创新推理,人类多因字面过度延伸。
句法信念更新作为花园路径加工困难的驱动因素
提出句法信念更新模型,用广义Rényi散度度量更新幅度,不依赖词汇概率,更好拟合花园路径句阅读时间。
进化语义学中的组合性与词汇
提出词汇与组合函数共进化框架,发现保守性为高效系统抽象,调和量词学习与进化模型张力。