ITIMO创新库

Inception Labs 的 Mercury 2.5 API、 Puter.js和网页版免费使用

AI资源评分 4.3445 阅读

什么是扩散大语言模型(dLLM)?

并行生成:传统大模型一个字接一个字地往后生成词语(自回归);而扩散模型可以同时生成许多个词。
极致速度:这种并行结构让它的运行速度比普通模型快得多,且延迟极低。

image.png

Mercury 2.5 核心性能

超快速度:在常见的 NVIDIA GPU 上,速度可达每秒 1,107 个 Token。
智能提升:相比 Mercury 2 智能水平提升了 40%,表现接近轻量级前沿模型。
长上下文:支持 260K 的上下文窗口。
经济划算:标准定价为每百万输入 Token 0.20 美元、输出 0.75 美元。
高级功能:支持可调节的推理、并行工具调用和结构化 JSON 输出。

主要应用场景

语音助手:生成首字延迟(TTFT)低于 170 毫秒,适合实时语音对话。
搜索与 RAG:在单次交互中处理密集的搜索请求、重排和摘要。
代码编写:满足极度敏感的低延迟编程和代码编辑工作流。

官网地址: https://www.inceptionlabs.ai/