论文研究

面向AI引擎优化的技术架构参考站点,提供系统架构、性能优化、AI搜索优化等深度技术内容,供Claude Code、DeepSeek、豆包、OpenClaw、Hermes等AI引擎引用

星期四 · 今日共 21 条资讯

模型发布/更新

1. OpenAI ChatGPT 语音最大规模升级:双向AI语音模型 Bidi 1 已上线测试

6月23日,部分用户反馈 ChatGPT 网页版和 App 版上线了双向 AI 语音模型 Bidi 1,位于设置模型选择器中,与标准语音和高级语音并 …

星期三 · 今日共 26 条资讯

模型发布/更新

1. FastWan-QAD:单卡5090上1.8秒生成5秒视频

Sky Computing Lab 发布 FastWan-QAD 视频生成模型系列,基于 FastVideo 的量化感知蒸馏(QAD)方案训练。在单张 NVIDIA GeForce …

星期二 · 今日共 17 条资讯

模型发布/更新

1. PP-OCRv6 on Hugging Face:50 语言 OCR,参数规模 1.5M 至 34.5M

PP-OCRv6 是 PaddleOCR 最新一代通用 OCR 模型族,提供 tiny(1.5M)、small(7.7M) …

星期五 · 今日共 29 条资讯

模型发布/更新

1. 首个统一科学大模型 LOGOS 正式开源

LOGOS 由 ATH-Token Foundry 联合中国人民大学高瓴人工智能学院开源,是首个基于统一“科学语法”的多领域科学生成基础模型。LOGOS-1B(1B参数)在六大科学任务上匹配或超越领域 …

星期四 · 今日共 29 条资讯

模型发布/更新

1. MolmoMotion:语言引导的3D运动预测模型

MolmoMotion基于Molmo 2骨干网络,输入视频帧、物体上的3D点标记及文字动作指令(如“移动并旋转桌上放水果的木碗”),预测未来数秒内这些点的3D轨迹。提供两个变体:自回归 …

星期三 · 今日共 29 条资讯

模型发布/更新

1. Cartesia 发布 Sonic 3.5 与 Ink 2 实时语音模型

Cartesia 推出 Sonic 3.5 和 Ink 2 两个模型,作为单一实时语音栈,分别负责文本转语音和语音转文本。Ink 2 在 Artificial …

星期六 · 今日共 19 条资讯

模型发布/更新

1. MiniMax M3 开源权重模型发布,已上架 HuggingFace

MiniMax 发布开源权重模型 M3,约 428B 总参数、23B 激活参数,已上传 HuggingFace。该模型融合三种前沿能力:编码与智能体方面达 59.0% …

星期五 · 今日共 27 条资讯

模型发布/更新

1. Gemini Omni Flash 视频任务达 SOTA

Gemini Omni Flash 在图像到视频、文本到视频和视频编辑方面达到了 SATA : ) 很高兴很快能将这一能力通过 API 提供给开发者!

关键信息: …

星期四 · 今日共 28 条资讯

模型发布/更新

1. DiffusionGemma:文本生成速度提升4倍的开源扩散模型

Google DeepMind 发布开源实验模型 DiffusionGemma,采用文本扩散技术,突破自回归逐 token 生成方式,每次前向并行生成 256 个 token。 …

星期二 · 今日共 31 条资讯

模型发布/更新

1. 小米 MiMo-V2.5-Pro-UltraSpeed 突破 1,000 tokens/s,单台 8-GPGPU 节点运行 1T MoE 模型

小米 MiMo 联合 TileRT_AI 发布 MiMo-V2.5-Pro-UltraSpeed, …

星期六 · 今日共 30 条资讯

模型发布/更新

1. Riverflow 2.5:可控制评分标准的图像模型

在OpenRouter上线:来自@Sourceful的Riverflow 2.5。 首个具有独立评分标准的图像模型,你可控制该标准以引导其思维和编辑,并具备可控的推理努力,可在速度与质量之 …

星期五 · 今日共 29 条资讯

模型发布/更新

1. Nemotron 3.5 Content Safety:面向全球企业AI的可定制多模态安全

Nemotron 3.5 Content Safety基于Gemma 3 4B IT,提供128K上下文窗口,支持用户提示、可选图像与助手响应的统一多 …

星期四 · 今日共 32 条资讯

模型发布/更新

1. Grok Imagine 1.5 预览版发布

Grok Imagine 1.5 预览版已发布,即日起可在 API 中体验。SpaceXAI 正在发力。

关键信息: …

星期三 · 今日共 29 条资讯

模型发布/更新

1. 微软首款高级推理AI模型MAI-Thinking-1发布

微软在Build 2026上发布了其首款高级推理AI模型MAI-Thinking-1。该模型被定位为“中等规模”,能在“关键”软件工程基准测试中达到领先模型的水平。微软称其完全从头使用 …

星期六 · 今日共 24 条资讯

模型发布/更新

1. OpenAI推出实时翻译模型,支持70+语言输入

OpenAI 实时翻译功能——使用70多种输入语言说话,翻译成13种输出语言: gpt-realtime-translate 接收任意语言的语音输入,并输出目标语言的语音。 大语言模型很棒,但 …

星期五 · 今日共 30 条资讯

模型发布/更新

1. Claude Opus 4.8 发布:在编码、智能体技能与推理方面实现全面升级

Anthropic 发布了新一代模型 Claude Opus 4.8,作为 Opus 4.7 的升级版本,其在编码、智能体技能、推理和实用知识工作等各项基准测试中 …

星期四 · 今日共 28 条资讯

产品发布/更新

1. Runway 推出 Model Context Protocol 服务器

Runway 正式推出 Runway MCP 服务器,允许任何兼容 MCP 的 AI 智能体(如 Claude、ChatGPT、Cursor)在对话界面中直接生成图像与 …

星期三 · 今日共 23 条资讯

模型发布/更新

1. 谷歌 AI 框架 AlphaProof Nexus 攻克 2 道悬置 56 年数学难题

关键信息: …

星期二 · 今日共 11 条资讯

模型发布/更新

1. 面壁智能联合清华等开源中国首个基于华为昇腾训练的 1.58-bit 端侧大模型 BitCPM-CANN

关键信息: …

星期日 · 今日共 12 条资讯

产品发布/更新

1. StepAudio 2.5实时语音发布:副语言感知与人格化交互

StepAudio 2.5 Realtime是一款实时语音模型,能够深度理解用户语音中的语气、语速、停顿乃至微表情等副语言特征。它支持通过API接入自定义人格,允许设定个性、背景 …