无法迁移的安全性:可部署医疗语言模型中的跨语言临床正确性漂移
低资源环境下可部署医疗语言模型跨语言临床正确性显著下降,源于模型级别而非语言或任务。
何时使用额外上下文:基于证据的术语适应用于同声传译
提出EGTA框架,通过文档术语记忆和状态选词,提升同声传译中术语召回率与BLEU等指标。
拒绝编程的图书管理员:LLM代码生成中模型依赖的身份扮演
角色提示效果因模型而异,图书管理员角色在Claude上引发拒绝编码,降低正确率,验证模型依赖的行为偏差。
对话状态的多模态信号有多可靠?——基于远程双人协作任务的证据
语言特征预测准但泛化差,声学可靠性依赖身份,交互特征才是唯一可靠信号,地板主导性预测认知负荷不对称。
面向语言集成可靠性审计的多语言句子嵌入
多语言句子嵌入可替代翻译用于可靠性审计,且不改变评估可靠性。
分布偏移下基于令牌级离线策略学习的忠实生成
提出令牌级离策略标注(TOPL),通过区分令牌正确性实现忠实生成,在分布偏移下具有强泛化能力。
Oracle Gap and Signal Fidelity: A Fixed-Pool Diagnostic for Test-Time Collaboration
跨语言同形词的标记化处理
分词时用语言特定字符标记同形词,可改善多语言模型处理,机器翻译有微小提升但效果不一。
C$^2$KV: 压缩且可组合的KV缓存重用,用于高效LLM推理
提出C$^2$KV框架,通过学习位置无关的压缩可组合KV流形,大幅降低存储成本,实现17倍长上下文推理加速且保持生成质量。
用于引文功能分类的大语言模型
本研究系统评估多种大语言模型在引文功能分类上的性能,微调Falcon 7B达73.3%宏F1,并引入七类别新数据集AC3。
AEGIS:迭代安全防护的意识增强引导
跨度引导条件性有用,改变毒性降低与意义保留权衡,效果依赖生成器骨架和语言环境。
When a Name Is Not a Name: A Benchmark Dataset and Distilled Reasoning for Culturally Entangled Bangla Homographs in Low-Resource LLMs
ESCUCHA:面向异构声学条件的西班牙语音基准
ESCUCHA是首个西班牙语音基准,含1000个野外音频问题,评估模型推理,结果与人类差距大。
DeLIVeR:基于强化知识图谱探索的信息驱动真实性识别分解学习
提出DeLIVeR框架,将证据检索作为强化探索任务,通过策略优化提升事实核查F1达10-15%。
零幻觉,通过构造实现:面向可信企业AI的幻觉感知分层监督
HALO架构通过六层防御将幻觉视为可遏制故障,实现系统级零幻觉,确保企业AI可信。
对齐微调如何塑造LLM中谄媚及相关线索诱导偏见的表征
对齐微调而非预训练在LLM中植入多种独立偏见方向,通过因果干预可恢复无偏答案。
中文标题:源域偏移下什么能够迁移?定义、示例和微调在气候披露分类中的应用
中文摘要:研究发现,源域偏移下,简单策略更可靠:随机示例优于检索和LoRA微调,定义迁移需粒度匹配。
前沿大语言模型中新兴生物安全风险的早期预警
研究揭示前沿LLM可被诱导生成具病原潜力的序列并物理实现,需强化红队测试与合成筛查。
潘查希拉困境:基于印尼建国五原则的人类价值困境下的大语言模型评估
构建潘查希拉困境数据集评估50种大语言模型,发现其在宗教与团结价值上表现不佳。
运用远距离观察法建模话轮转换:探究人类与AI生成话语中的沉默阈值
研究对比人类情景喜剧与AI合成播客中的沉默间隙,分析性别与生产设置差异。
VDAR-Router:通过语言化查询难度分析检索的自适应LLM路由
VDAR-Router通过显式难度分析与历史检索,优化LLM路由的性能成本权衡。
PPL-Factory:从语言建模到推理的任务感知与预算感知数据选择
PPL-Factory利用任务与预算感知的困惑度选择数据,仅用1%训练集超越SOTA,10%时效果优于全量微调。
跨分支冲突之盾:统一多模态图像编辑中的人脸身份防护
通过破坏ViT和VAE分支的一致性,CCS有效防止身份编辑,性能优于现有方法。
SWE-Pruner Pro:编程大模型已自知修剪之道
基于代理内部表示修剪上下文,节省39%令牌,提升SWE-Bench 3.8%准确率,保持任务质量。
重要的不是你说什么,而是你怎么说:评估LLM对信念表达的反应
用户信念表达的语言形式影响LLM是否遵循上下文;大型和指令模型更不遵循,特定表达更具说服力。
VEHBench:面向大语言模型辅助振动能量采集器设计的阶段局部诊断基准
VEHBench是一个分阶段诊断基准,通过763个文献任务揭示LLM在不同设计角色的能力差异,为工程LLM评估与选择提供基础。
自动发现工具不存在普遍更优的框架
实验证明无固定发现框架普遍更优,OpenEvolve常不及简单方案,框架应作为超参数自适应选择。
One Modality to Forget Them All: Enhancing Cross-Modal Unlearning in Vision-Language Models
执行前先澄清:一个用于解决3D工具编排中意图不对称性的自进化智能体
CLARE智能体通过自进化澄清策略解决3D任务意图不对称,单步/多步成功率60.4%/43.3%,性能翻倍。
依赖引导的代码生成:结构化矩阵分解与一致性引导的精化
提出依赖感知代码生成框架,通过图表示和矩阵分解建模依赖,确保代码语义与结构一致性,效率显著提升。
多模态大语言模型能否理解OCT?
提出OCT-Bench基准(10076题,3维度20任务),评估20个MLLM,结果显示当前模型远未达到可靠OCT理解。
传统隐私政策分析工具与LLM的系统性评估
LLM在隐私政策分析中可替代传统专业工具,性能匹配甚至超越。
DRNOISE:在误导性证据环境中评估深度研究智能体
DRNOISE基准显示,误导证据使深度研究智能体准确率骤降66-88%,主因验证惯性,需主动调和声明与证据。
生成式AI中价值系统学习的一种方法
针对生成式AI,提出同时学习价值基础与价值系统的方法,提升可解释性且性能竞争。
持久稀疏自编码器:学习语言模型中的特征时间尺度
提出持久稀疏自编码器,通过学习特征持久系数,捕捉动态时间尺度,慢速特征保留主题信息,利于模型解释与监控。
SynH-Rank:通过多样化数据合成与层次排序训练实现质量感知的代码搜索
SynH-Rank利用LLM合成数据和层次排序训练,提升代码搜索质量感知,新基准上质量偏好准确率提高20.15%。
面向判例法的带围栏引文上下文检索:跨两个司法管辖区的时间泄露与程度控制
本研究揭示无时间围栏的引文检索会高估性能,仅少数增益源自未来证据,零训练方法在围栏下有效。
语义空间的几何:Transformer架构的连续几何框架
提出语义纤维丛上的连续几何框架,将Transformer建模为积分微分方程,实验验证了预测。
SlotGuard:防止LLM代理转录中过度共享私有本地上下文
SlotGuard通过槽替换和跨引用链接,消除敏感数据泄露,保持任务成功率,重写耗时仅14微秒。
越狱攻击如何指导安全对齐:一种以防御者为中心、基于Shapley值的越狱贡献评估
提出防御者中心的越狱评估,用Shapley值归因攻击,发现ASR排名与安全效用弱对齐,直接优化子集更有效。
欧几里得高速之后:双曲专家AI作为下一项创新
提出HySAT方法,仅在损失层施加双曲损失,避免训练崩溃,在六个专家SLM上稳定训练。
PoLoRA:一种预处理正交化LoRA优化器
PoLoRA通过乘积感知谱更新、曲率预条件和幅度规则,在1.2-1.7倍更少步数内达到Adam性能,且对学习率不敏感。
Salience Induction against Multi-Hop RAG Agents: Threat and Defense
EII-SCL:利用情感惯性进行对话多模态情感识别
针对忽视情感惯性的问题,提出EII-SCL模块,构造时序惯性样本增强对比学习,无需额外数据即提升性能。
WAR:面向同步智能体强化学习的工作负载感知轨迹生成
WAR通过负载感知解码与调度,低负载复用后缀推测解码,高负载缓存感知调度,提升同步RL回滚吞吐量1.4-1.6倍。
校准来自可观察语言模型概率的语义不确定性
提出语义映射法,用语言概率校准隐藏语义,实验显示优于数字概率且稳定。
D-NOVA:基于双边界3D NAND优化的向量自适应存储内检索加速器
D-NOVA将搜索嵌入NAND单元,通过DTS度量和向量适配,比CPU快41.7倍、能效高71倍,实现存储内向量搜索加速RAG。
长上下文智能体仅需渐进式披露吗?
单层渐进式披露优于原始导航,两层无益;强框架下冗余,大语料时关键。
视频中的思考:视频生成器真的能推理现实世界吗?
视频生成器推理现实世界存在感知-预测差距,因果理解不足。
Abliteration 并非手术刀:拒绝移除对跨模型家族决策倾向的非目标影响
去除拒绝导致非目标效应:模型更乐观、辩解增多、少用不确定词;自信方向因家族而异,无经济收益。