ITIMO创新库

实时信息流

仅保留近一个月的消息
  • Lux3D:3D 生成正从"提示词"走向"API 调用"

    Manycore Tech 发布新 3D 生成模型 Lux3D,最快 20 秒生成 3D 资产,支持高质量材质纹理与 Harness Mode 批量创建。Rohan Paul 指出,其 API 可被编码智能体反复调用,从规格说明批量生成 3D 道具并送入 Blender 处理,使 3D 生成成为更大智能体执行循环中的一环,而非简单的“图生 3D”工具。

  • 谷歌发布 Gemini 3.5 Transcribe 语音转文本模型,能自动删除口头禅

    谷歌发布 Gemini 3.5 Transcribe 语音转文本模型,可自动删除“嗯”“呃”等口头禅及说错后自行纠正的内容,生成更通顺的文本。相比 Chirp 3,整体速度预计提升约 70%,实时语音场景错误率降至 5.5%,支持 85 种语言及最多 3 名说话者的预录音频。该模型已为 Pixel 11 上 Gboard 的“Rambler”功能提供支持,后续将进入更多谷歌产品。

    在外界仍等待 Gemini 3.5 Pro 发布之际,谷歌先推出了 3.5 系列中的另一款模型。该公司今日发布了 Gemini 3.5 Transcribe 语音转文本模型,这是一款旨在优化语音输入体验的 AI 模型,能够自动删除语音中的“嗯”“呃”等口头禅以及说错后自行纠正的内容,最终生成更加通顺、整洁的文本。

  • Meta 的 Muse 图像模型现已在 OpenRouter 上线

    Meta 的 Muse 图像模型现已在 OpenRouter 上线。基于搜索增强,定价面向生产级用量,每张图像 $0.01。 可创建和编辑复杂图像,且保留未修改部分不变,价格极具竞争力,让大规模创意工作成为可能

  • Z.ai 发布 GLM-5.3-Flash:320B-A18B 原生多模态 MoE,支持 100 万 token 上下文

    Z.ai 发布 GLM-5.3-Flash,这是 GLM-5 系列首款原生多模态模型,320B 总参数、18B 激活参数,支持 100 万 token 上下文和图像/视频输入,权重以 MIT 许可开源在 Hugging Face。

  • Recraft V4 Styles 已在 OpenRouter 上线

    Recraft V4 Styles 已在 OpenRouter 上线。 精确模式遵循纹理、构图、色彩和渲染,而不仅仅是整体外观。可使用来自其他生成器、品牌素材或现有资产的 1-10 个参考。 来自 @recraftai 的 Styles、Vector、Pro 和 Pro Vector 如下 ↓ https://openrouter.ai/recraft

    Recraft V4 Styles is live on OpenRouter.

    Precise follows texture, composition, color, and rendering, not just the overall look. Use 1-10 references from other generators, brand materials, or existing assets.

    Styles, Vector, Pro, and Pro Vector from @recraftai below ↓ https://openrouter.ai/recraft

  • Qwen3.8-Flash-Next 今日发布,6B 激活参数

    通义千问(Qwen)即将发布 Qwen3.8-Flash-Next,作为 Qwen4 架构的预览版,今日正式开放。据已下架的 ModelScope 页面显示,该模型采用多模态 MoE 架构,总参数约 176B(125B 主参数 + 51B N-gram 嵌入),但每 token 仅激活 6B 参数。最终 benchmark 表现值得关注。

  • IBM 发布开源 Granite 4.2 系列,内置智能体能力并采用 Apache 2.0 许可

    IBM 发布 Granite 4.2 语言模型,提供 3B、8B 和 30B 三种尺寸,基于约 15 万亿 token 从头训练,支持最高 512,000 token 的上下文窗口,并可在“思考”与“非思考”模式间切换以控制每项任务的计算量。

    image.png
  • Harvey 发布自研模型 Tenet,基于 Kimi K3

    OpenAI 支持的律所 AI 公司 Harvey 发布首个自研模型 Tenet,基于中国开源权重模型 Kimi K3,用约 150 块 Nvidia B300 训练两个月。

    image.png
  • 6 天内处理了 42T tokens 的 Ox Alpha 继 DeepSeek Flash 56 天运行后使用最多的模型

    6 天内处理了 42T tokens 的 Ox Alpha 继 DeepSeek Flash 56 天运行后使用最多的模型

    42T tokens of Ox Alpha in 6 days

    Most used model after DeepSeek Flash's 56 day run

    image.png
  • 小鹏 G9L 首发搭载第二代 VLA 全新版本,X-Foresight 世界预测模型可推演未来 6 秒环境运动轨迹

    小鹏汽车副总裁宣布,小鹏 G9L 将首发搭载第二代 VLA 全新版本,具备 30 秒有效时序,首次将记忆加入智驾决策,并通过 X-Foresight 世界预测模型推演未来 6 秒环境运动轨迹。该版本端到端响应速度提升 300%,端侧模型参数量提高 3.5 倍,为行业主流 VLA 模型的 15 倍。小鹏 G9L 已开启预售,预售价 25.98 万元起。