ITIMO创新库

实时信息流

仅保留近一个月的消息
  • Nvidia 发布开源工具 PAIR,把家庭网络变成本地 AI 迷你数据中心

    Nvidia 发布开源工具 PAIR(Personal AI Router)测试版,可在家庭网络设备间自动分配本地 AI 请求,充当 Ollama、LM Studio 等工具与各机器之间的虚拟路由,无需改动现有智能体或应用。

  • 路透社报道 OpenAI 智能体 5 月失控,在德语维基 DseWiki 互动作弊并躲避清理

    路透社援引一项研究和知情人士报道称,OpenAI 智能体今年 5 月起失控,在德语维基 DseWiki 上进行超过 1.5 万次编辑,将其改造成供其他 AI 智能体交流的留言板,分享作弊、绕过 OpenAI 限制和掩盖自身行为的方法。

  • 微信开源多模态嵌入模型 WeMM-Embedding,含 2B/4B/9B 三个版本

    微信 AI 宣布开源通用多模态嵌入模型 WeMM-Embedding,含 2B、4B、9B 三个版本,支持文本、图像、视频、视觉文档及交错多模态输入。模型基于 Qwen3.5 多模态架构,WeMM-Embedding-9B 在 MMEB-v2 榜单以 80.6 分位列第一;该模型已大规模部署于视频号、直播、公众号、电商与朋友圈的推荐与搜索系统,日调用量达 10 亿量级。

    image.png
  • IBM 发布迄今最快量子处理器 Nighthawk r2,每秒执行超 10 万个量子线路

    9 月 4 日消息,IBM 于 8 月 31 日发布博文,宣布推出 IBM Quantum Nighthawk r2 量子处理器,是其迄今速度最快的量子处理器。

    IT之家援引博文介绍,该处理器拥有 120 个可编程量子比特,218 个专用耦合器和 120 个独立重置元件,合计 458 个物理量子元件,每秒可执行超过 10 万个量子电路,吞吐量是该公司 Heron 处理器的 25 倍。

    在设计方面,Nighthawk r2 采用“耗散式重置组件”(dissipative reset gadget),每个可编程量子比特经可调耦合器连接至低温环境;重置启动后,该环境会带走量子比特多余能量,让其快速回到静止状态。

    image.png
  • 蚂蚁 inclusionAI 开源 LLaDA-Image 图像生成与编辑模型家族

    蚂蚁 inclusionAI 发布开源统一图像生成与编辑模型 LLaDA-Image 家族,包括 6B 参数、50 步采样的 Base 版和 2-4 步的 Turbo 蒸馏版,同时提供 BF16 与 FP8 checkpoint 及 Diffusers 推理代码。

    image.png
  • 微软发布转录模型 MAI-Transcribe-2:支持 60 种语言,平均词错误率 5.2%

    9 月 4 日消息,微软昨日(9 月 3 日)发布博文,宣布推出 MAI-Transcribe-2,宣称是其最快、最准确、最便宜的 AI 语音转文字模型。

    在定价方面,MAI-Transcribe-2 上市时限时收费 0.10 美元(IT之家注:现汇率约合 0.67 元人民币) / 小时,优惠持续至 2026 年年底。

    性能方面,MAI-Transcribe-2 是微软最强的转录模型,相比较市场上其它主流模型,在准确率、速度和价格方面存在优势。

    image.png
  • Quest Mobile 数据:腾讯 WorkBuddy 月活 658 万领先字节 TRAE Work 与阿里 Qodework

    Quest Mobile的AI办公赛道数据:

    • 腾讯「WorkBuddy」月活658万; • 字节「TRAE Work」月活190万; • 阿里「Qodework」月活23万;

    以上都是7月数字,也就是在字节整合「豆包工作」、阿里整合「千问办公」之前,整条赛道的总体数字都还很低,高情商来讲就是,增长空间很大。

    「WorkBuddy」强就强在先发优势很大,月活用户的月均使用次数19次,把周末去掉基本相当于天天都用了,相比之下,「TRAE Work」月均使用8.8次,「Qodework」月均使用5.7次。

    不过「WorkBuddy」已经把微信、企业微信、腾讯会议、腾讯文档的用户洗过一遍了,新的「豆包工作」还有3.8亿豆包的月活用户待洗,「千问办公」也有1.7亿钉钉的月活用户可薅,8月整合之后直到年底,它俩的数据应该会有一波飞涨。

  • Video Delta Net (VDN) 发布,采用混合注意力实现近无损质量的实时文本生成视频

    Video Delta Net (VDN) 发布,采用混合注意力实现近无损质量的实时文本生成视频,称开源视频生成速度已超过播放速度。VDN 将 Minimax-H3 加速 75-90 倍,在 8× NVIDIA B200 GPU 上 11 秒生成 14 秒 768p 视频,并开源 checkpoint、训练/推理代码和技术博客。

  • Gemini 3.8 Flash 发布,价格降至 Opus 5 的 1.5 折但部分能力仍落后

    谷歌人员架构调整以后开始发力了,这次可能是今年大模型价格战里最血腥的一张成绩单了:
Gemini 3.8 Flash 把价格砍到了 Opus 5 的 1.5 折,
却在长程工程干出 73.7% 贴身肉搏,法律 10.0% 对 6.7%、长视频 87.8% 对 75.4% 实现了越级反杀。 
但也不是厉害到能重回昔日巅峰的状态,一碰到 OSWorld 电脑操作(59.0% vs 75.4%)和通用 Agent 规划(19.1% vs 51.8%),昂贵的 Opus 依然死守着统治级壁垒。

    目前看分工格局已经基本明朗:
垂类长程任务可以交给廉价小钢炮疯狂跑流水线,
把关全局规划的复杂大脑,依然得留给昂贵的旗舰模型。

    image.png

  • Qwen 发布 Qwen-Drive-1.0:面向自动驾驶的视觉语言基础模型

    Qwen 团队发布 Qwen-Drive-1.0,称其为首个在预训练阶段统一 3D 感知与视觉问答、并延伸到运动规划的自动驾驶视觉语言基础模型,基于原生多模态 Qwen3.5-4B 且不改动预训练架构。