ITIMO创新库

实时信息流

仅保留近一个月的消息
  • 小米开源工业级目标说话人语音识别大模型 Xiaomi-CocktailASR-1

    小米发布并开源工业级目标说话人语音识别大模型 Xiaomi-CocktailASR-1,针对多人同时说话时识别率大幅下降的鸡尾酒会难题。模型采用端到端 LLM 架构,以目标说话人参考音频作为声纹提示,在多个主流多说话人测试集上达到 SOTA;单人识别性能比肩标准 ASR 模型,可拒识非目标说话人并支持思维链推理模式。代码开源于 GitHub 和 HuggingFace。

    image.png
  • X-AuT:面向语音 LLM 的渐进式音频编码器压缩与跨尺度蒸馏

    X-AuT 通过渐进式剪枝与跨尺度蒸馏压缩语音 LLM 的音频编码器,将 Qwen3-ASR-0.6B 的 18 层音频 Transformer 压到 16 层,十个中英文基准的宏平均错误率从 5.61% 降至 5.27%。压到 14 层时错误率为 5.75%,音频塔参数减少 20.7%。相同配方下,1.7B 教师模型带来 5.55% 平均错误率,优于自蒸馏的 8.45%。

  • UniH3:统一分层同质性与异质性的全能医学图像修复框架

    北航与清华团队提出 UniH3 框架,通过分层同质性记忆(H2M)模块从高质量图像中蒸馏任务内与任务间先验,并用同质性引导注意力(HGA)注入修复流程,同时以分层异质性平衡器(H2B)缓解任务内与任务间优化冲突。在 MedIR-2D-500K 和 MedIR-3D-3K 两个大规模基准上,UniH3 在全能及单任务医学图像修复中均达到 SOTA。代码已开源。

  • Google Research 发布 ToolGrad

    Google 联合东京大学、RIKEN AIP 和东北大学发布 ToolGrad,将工具调用数据生成流程反转为先构建并实际执行验证工具链、再生成用户查询,在 ToolBench 上通过率从 63.8% 提升至 99.8%。

  • 阿里千问新款 AI 眼镜 N1 保密式展出:首次支持虹膜识别,不带显示屏

    千问新款 AI 眼镜 N1 在 2026 年外滩大会 AI 支付展区以黑色遮蔽材料包裹的方式展出,首次引入虹膜识别能力,误识率低于百万分之一,可在复杂环境下通过眼动追踪收银设备、佩戴即完成身份核查。该产品不带显示屏,工作人员透露定价可能低于 S1。千问此前已推出 S1、G1 等 AI 眼镜,并在 7 月世界人工智能大会上展示全双工语音、眼动追踪、体征监测等技术。

    image.png
  • TRL v1.13 发布!我们的开源 RL 训练库,用于对基础模型进行后训练 本次新版本聚焦"长上下文训练"

    TRL v1.13 发布!我们的开源 RL 训练库,用于对基础模型进行后训练 本次新版本聚焦"长上下文训练",新增了一份关于如何用 1M+ token 上下文对模型进行后训练的指南 https://huggingface.co/docs/trl/long_context_training ,以及一如既往的速度和内存使用方面的多项改进 详见 https://github.com/huggingface/trl

  • 腾讯混元开源语音模型 AuK,统一语音生成与编辑并推出 4 步推理的 AuK-Flash

    腾讯混元发布开源语音基础模型 AuK,支持统一语音生成与编辑,可通过自然语言指令加参考音频实现零样本 TTS、指令控制生成、内容与音色/风格/情感编辑、去口音、语速音调控制、增强去噪及多说话人和音乐分离。

  • DeepMind 工程师反驳"谷歌搞不出前沿模型":Gemini 3.8 Cyber 多项测试优于 Mythos

    针对 AI 研究员 Ethan Mollick 称谷歌已不再拥有前沿模型的言论,谷歌 DeepMind 工程师 Logan Kilpatrick 反驳称,Gemini 3.8 Cyber 在许多网络安全测试和实际应用能力上已超过 Anthropic 的 Mythos。他表示谷歌内部 Chrome、Wiz 和 Cloud 团队已广泛使用该模型,Gemini 4 系列将继续推动前沿网络安全模型发展。

  • NVIDIA 发布 CUDA 13.4,为 Windows on Arm 带来 CUDA 支持,赶在 10 月 RTX Spark 笔记本上市前让开发者准备应用

    NVIDIA 发布 CUDA 13.4,为 Windows on Arm 带来 CUDA 支持,赶在 10 月 RTX Spark 笔记本上市前让开发者准备应用。NVIDIA 与 Microsoft 将 RTX Spark PC 定位为运行本地 AI 模型和个人智能体的设备;GPU 加速仍需兼容的 NVIDIA 硬件,现有 Arm PC 可帮助开发者开始移植。

    image.png
  • 高德发布 3D 原生城市世界模型 ABot-Earth 0.7,支持从星球到街景全尺寸生成

    高德发布 3D 原生城市世界模型 ABot-Earth 0.7,称其为全球首个全模态、可预测的 3D 原生城市世界模型,覆盖超过 196 个国家和地区。模型可从卫星图像或文字描述出发,10 分钟内在一块消费级 GPU 上生成公里级 3DGS 格式城市场景,效率较传统模式提升 1000 倍,已应用于飞行街景 2.0,体验官网同步上线。

    image.png