从网络(日志)到网络(AI):ICWSM二十届年会中的问题、平台与方法
分析ICWSM 2139篇文献:平台焦点从博客转向Twitter、Reddit,治理与危害议题上升,方法持续演进。
MLLM评委真的在评判编辑吗?在经验证质量保持的图像编辑评估中审计偏差
提出EditJudgeBias基准,经质量保持验证后审计五个MLLM评委,发现无关线索均造成超出自身噪声的偏差。
修复一个学到“癌症越严重意味着风险越低”的模型:膀胱癌复发预测中的单调约束
无约束模型将高分期/原位癌学成低复发风险,常规检查未察觉;反事实测试加单调约束可消除且不损性能。
重新思考扩散模型中的记忆缓解:强化文本条件
提出免训练法:高斯平滑重分配交叉注意力,强化内容词元并抑制填充,兼顾提示对齐与缓解记忆。
别浪费噪声:全局与局部联合约束下的重要性引导扰动分配
提出重要性引导扰动分配,在共享ℓ1预算与局部约束下,将扰动重分配至高敏感区,不增预算并提升攻击成功率。
衡量动作分块背后的稳定性假设
动作分块中,注入动作误差测开/闭环传播,稳定罕见、误差放大常见;误差复合解释不足,需显式训练闭环恢复。
DiVid:诊断视频生成模型中特定维度的多样性坍缩
DiVid将视频生成多样性分为语义、风格、运动等六维诊断,发现全局高分模型仍在运动与镜头维度坍缩。
当文生图助力编辑:去噪期间条件作用的影响
统一编辑器可在去噪中有界切换至文生图任务,借其能力提升编辑质量,并靠切换时机平衡质量与源图保持。
大语言模型品牌推荐中的系统归因:单条回答可识别系统,聚合品牌画像无法迁移
单条回答可高精度识别LLM系统,聚合品牌画像跨域不迁移。
CoEvolve:基于双向状态精炼的“构建—编辑”式视觉定位
CoEvolve将视觉定位分为状态构建与编辑,双向精炼修正坐标,9B模型精度媲美241B模型。
架构采样:通过冻结视觉-语言模型中的计算多样性实现测试时扩展
提出免训练架构采样,通过复用解码器层块产生多样计算路径,pass@9平均提升6.58个百分点。
重新思考协变量偏移下的数据增强:不变引导扩散与原型重加权
针对协变量偏移下数据增强的生成误导与重加权不稳,提出不变引导扩散与原型重加权框架IGDPR。
Clock Diffusion:高效半自回归连续扩散语言模型
提出时钟扩散,用位置相关噪声调度实现半自回归连续扩散语言模型,支持变长与KV缓存,在多项基准领先,并推出Cache Grab采样器。
智能体编程任务上强化学习的跨基准迁移
在1700个智能体编程任务上做强化学习,六个外部基准均提升,实现显著跨基准迁移且轨迹更短。
MEGA:通过空间视觉蒸馏从3D高斯泼溅中提取对象级网格
提出MEGA,通过空间视觉蒸馏从3DGS提取对象级水密网格,实现高精度占用与逼真渲染。
即时权重生成:基于 ARC-1D 的超网络概念验证
以 ARC-1D 为测试平台,超网络可从少量示例即时生成专用模型参数,形成结构化权重空间,并泛化至未见变换。
匹配分布,而非算力:后训练多Token预测头
后训练MTP头仅用极少Token,在冻结模型上达到联合训练加速;链感知验证放宽和自适应头选择进一步提速。
将 CPU 语音合成推向极限:无服务器架构与计费下的极致推理调优
面向按实例计费的无服务器CPU,用请求级并发与可回收实例生命周期优化TTS,降本4.1倍并减少闲置内存。
AnyJev 技术报告
AnyJev单次预填充读取类型化决策,免训练校正标签与位置偏差,旋转平均和停止规则提升准确率并省算力。
KaliBench:面向 Kali Linux 网络安全工具使用的细粒度基准,兼具免运行时可验证奖励
KaliBench:Kali 安全命令基准;开源模型准确率不足42%,其奖励训练使8B媲美685B。
向语言模型索要彩票号码:重复六选49输出中的集中现象
六款语言模型生成1—49随机数时输出高度集中:多样性远低于均匀抽样,众数票占比达22.5%—68%。
令牌化密钥门控适配器路由:一种防止大语言模型私有数据泄露的安全访问控制机制
提出Locket:以密钥令牌门控LoRA适配器路由,实现LLM细粒度访问控制;有效令牌解锁私有知识,无效则脱敏,兼顾效用与隐私。
体积、延迟与隐私约束下的端侧商业意图检索:带类型化出站边界的 3 MiB 检索系统
端侧商业意图检索:3MiB、20ms、数据不出端;6020类4位嵌入,韩语商品Top-5达75%。
逃逸攻击:对抗噪声如何绕过机器学习分类器
对抗噪声使MNIST分类准确率大幅下降,位深防御仅部分恢复;文本扰动未致标签翻转。脆弱性随模态而异,鲁棒性须实测。
3DROID:一个可渲染的3D高斯数据集,附带逐场景实测可靠性
研究外参可靠性对前馈3DGS的影响,提出校准感知流程,将重建场景锚定到机器人度量工作空间,发布带场景级可靠性信息的可渲染数据集。
连续条件化VLA:融合肌电与视觉任务描述符
提出肌电条件化EC-VLA与视觉标注VA-VLA,在杂乱分布外场景下均显著优于语言提示基线。
ATI-VLA:通过可操作对齐与自适应注入的以动作为中心的预测式视觉-语言-动作模型
共享码本对齐观测与动作表征,轻量侧路自适应注入预测潜变量,以动作中心单目标训练,仿真与真机均达SOTA。
FFBL-Coop:关联解耦的协同3D多目标跟踪
提出"先融合后绑定"的FFBL-Coop,解耦实例准入与身份管理,提升协同3D多目标跟踪精度与连续性。
PhysDEM:稀缺测量下时空场生成的物理定义能量匹配扩散
提出PhysDEM,融合物理方程与稀疏观测,无需全场地数据即可生成多可能时空场。
GIFTBench:诊断图像伪造定位中的泛化能力并指导模型设计
GIFTBench多轴基准揭示跨源迁移不对称等泛化问题,并指导设计出ForenScope框架。
Cog-VADU:面向视频异常检测与理解的免训练认知推理框架
提出免训练框架Cog-VADU,将视频异常检测重构为序列认知推理,结合跨模态重排序,提升零样本可解释性。
GenCOPE:面向机器人抓取的合成到真实泛化类别级物体位姿估计
仅用合成数据训练,借助2D-3D语义一致性与跨模态融合,实现轻量高效且可泛化至真实的类别级物体位姿估计。
OneStreamer:统一流式视频交互中的感知、记忆与主动响应
OneStreamer统一流式视频感知、记忆与主动响应,构建百万级数据,4B模型在八项基准领先。
VETO:面向视觉语言模型的视频高效令牌优化
VETO为训练可选插件,以帧内/帧间双轴令牌压缩加速长视频VLM,最高提速45%,精度保持或提升。
@dotey:帮转程序员求职,需要 H1B 雇主担保
程序员求职,需 H1B 雇主担保,欢迎转发。
@dotey:Codex 又要重置了,美国时间 10 月 2 日上午 10 点重置,即北京时间 10 月 3 日凌晨 2:00
Codex 将于美国时间 10 月 2 日上午 10 点(北京时间 10 月 3 日凌晨 2 点)重置,蹬起来。
@emollick:“我们发现,在中等长度、定义明确的会计任务上,前沿AI模型如今比初级会计师更快、更准确,甚至优于我们研究中最优秀的那位。”18个月前,它们的得分还远低于人类会计师。
前沿AI在中等长度明确会计任务上已比初级会计师更快更准,18个月前还远逊人类。
Anthropic 为 Claude Code 推出 Mod 功能
Anthropic为Claude Code新增Mod功能;AI助手可用自然语言读改代码、执行命令。
自动驾驶出租车运营商阻碍急救人员将面临罚款
加州新法规定,自动驾驶运营商若阻碍急救人员将受罚。
@karpathy:我们将花更多时间尝试理解语言模型的输出。几点思考、技巧与窍门:
将花更多时间理解语言模型输出;可让LLM用ASD-STE100受控语言解释以助写作。
@NVIDIAAI:祝贺 @CoreWeave 推出 RL Rollouts!
RL后训练反复训练与生成,推理端需重载新权重,模型变大易使GPU空等;CoreWeave推出新方案。
学术界属于有抱负的人——麻省理工学院的 Alex Zhang
对话 RLM 一作、MIT 博士 Alex Zhang:谈 Jev、读博最大化与评测框架的未来。
@swyx:为 @aidotengineer nyc 更换我的个人标语
为 @aidotengineer nyc 更换标语;提前飞往纽约动漫展,11 天后见。
创始人指南:2026 年 TechCrunch Disrupt 全知道
2026 年 Disrupt 聚焦一个核心议题:AI 时代如何打造基业长青的公司,议程与讲者阵容均围绕此展开。
我们是在培育软件,还是在设计软件?
对比 vibe-coding 的有机“生长”与状态机、形式化验证的确定性“设计”。
Chatham 借助 OpenAI 扩大资本市场专业能力
Chatham Financial 用 Codex 和 GPT-5.6 重塑工作流,交易验证从30分钟缩至4分钟内。
@bilawalsidhu:迪拜航空事故的第一人称视角,简直是一场惊心动魄的过山车。
迪拜航空事故第一视角:峰值下降31000英尺/分,30秒坠沙漠,上帝视角和航班数据重建;注视地平线。
无论AI安全是什么,都不是这个
要求AI公司自我监管,不过是假装有所成就的把戏。
@dotey:传闻 Fable 5.5 将至,其打造的网页可随经过图片的艺术风格动态变换自身风格
Fable 5.5 网页能随经过图片的艺术风格动态变换自身风格,并附在线演示。
Lyft将支付2.725亿美元,以和解关于其如何对司机进行分类的诉讼
Lyft支付2.725亿美元和解司机分类诉讼,了结2020年悬而未决的争议。