Liquid AI发布端侧智能体模型LFM2.5-2.6B
8月5日,AI初创公司Liquid AI发布面向智能体工作流的端侧模型LFM2.5-2.6B。该模型拥有26亿参数,可在智能手机等终端本地运行,无需依赖云端API,面向低成本、低延迟和隐私保护场景。LFM2.5-2.6B基于约34万亿词元预训练,词表扩展至128K,并经过监督微调、教师特化、策略蒸馏和智能体强化学习等阶段训练,支持规划、工具调用和多步骤任务处理。其已在Hugging Face开源,并支持llama.cpp、MLX、vLLM等推理框架。
腾讯混元发布 Hy ASR3.0 Preview,方言识别覆盖十大方言片区
腾讯混元推出新一代语音识别模型 Hy ASR3.0 Preview,基于大语言模型 Hy3 构建,融合语音识别与语义理解能力。该模型支持粤语、吴语等十大方言片区及20余个二级小片区,开源评测集显示多语种词错误率约3%,其中普通话3.34%、英语2.62%、粤语3.12%。技术上,模型采用 MoE 架构,并通过数千万小时级无监督及多来源语音数据联合训练,强化上下文感知、专业名词识别和复杂环境鲁棒性。目前该模型已在腾讯云开放 API,腾讯 AI 助手“元宝”已接入,WorkBuddy 等产品将陆续接入。
即梦 AI 接入 Seedance 2.5,上线 Maya 与 Blender 插件
字节跳动旗下内容创作平台即梦 AI 已接入视频生成模型 Seedance 2.5,并上线 Maya、Blender 插件及智能编辑模式,面向影视、动画、三维设计等专业场景扩展工作流。Seedance 2.5 支持单次生成最长 30 秒视频,可进行多镜头叙事,并在多轮延长生成中保持人物、场景、风格和声音一致。新插件可在主流三维软件内调用生成与编辑能力,智能编辑模式支持局部修改、场景替换、人物调整和风格变换。
世界银行建议新兴经济体优先部署本地化低成本 AI 工具
世界银行最新报告指出,发展中经济体应尽快将人工智能用于政府治理和企业经营,并围绕本地需求改造现有工具,而非与富裕国家竞争大型数据中心和大语言模型。报告认为,小型、低成本、本地化 AI 工具更有助于改善医疗、教育、农业和法律服务,并缓解专业人才短缺。世界银行同时警告,若互联网、电力、技能、制度和融资等基础条件不足,AI 可能扩大数字鸿沟,并带来部分外包岗位萎缩、网络犯罪和技术依赖等风险。
无问芯穹与 MiniMax 达成战略合作,共建大模型推理与 Token 服务体系
上海无问芯穹智能科技股份有限公司与上海稀宇科技(MiniMax)近日签署战略合作协议。双方将在模型推理效能体系优化、大模型 Token 服务与 AI 基础设施共建、应用范式联合创新及行业智能化场景拓展等方面开展合作。无问芯穹将发挥算力调度与推理基础设施能力,MiniMax 将结合自研大模型及应用场景资源,推动国产大模型从推理优化、服务供给到行业落地的协同建设。
Mistral AI 发布 3B 内容审核模型 Shieldstral,支持单卡多模态审核
Mistral AI 于 8 月 4 日发布内容审核模型 Shieldstral-1.0-3B,采用开放权重并以 Apache 2.0 许可证上线 Hugging Face。该模型参数规模为 30 亿,支持 12 种语言,可在单张 16GB GPU 上运行。Shieldstral 将审核政策写入输入,通过二元问答对提示词、回答、拒答、毒性及图像文本等内容进行评分与判断。Mistral 称,其内容安全性能可媲美规模大 7 倍的开放模型,并在多模态审核任务中达到开源 SOTA。
普利策奖AI使用披露创新高,8位获奖者及入围者申报应用AI
据尼曼实验室8月5日报道,今年共有8位普利策奖获奖者及入围者向评审委员会披露使用人工智能,包括5位获奖者和3位入围者,创2024年引入AI申报规则以来新高。相关应用主要集中在海量文档检索、数据整理、翻译和交叉核验等采编基础环节。《华尔街日报》、美联社、《纽约时报》等机构均披露使用大语言模型辅助处理公开文件或核验分类。普利策奖管理机构表示,明年起AI使用申报规则将扩展至图书类奖项。
Visa 将以 24 亿美元现金收购 AI 防诈公司 BioCatch
Visa 宣布将以 24 亿美元现金收购以色列 AI 金融防诈公司 BioCatch,交易待监管批准,预计在 2027 财年第二季度末前完成。BioCatch 成立于 2011 年,利用 AI 和机器学习分析网银行为、设备信息及网络信号,识别账户盗用、虚假开户和被胁迫转账等风险。目前其服务全球 21 个国家逾 350 家金融机构,每月分析约 190 亿次交互,覆盖 7.6 亿用户和 18 亿台设备。Visa 称,该收购将把防诈能力前移至开户、登录和账户操作环节。
宇树科技启动科创板IPO初步询价,拟募资42.02亿元
8月5日,人形机器人企业宇树科技启动科创板IPO初步询价,询价时间为当日9:30至15:00,保荐人及主承销商同步开展网下投资者核查。公司计划于8月6日确定发行价格、有效报价投资者及可申购股数,8月10日启动网上、网下申购,8月12日为缴款截止日。本次拟公开发行4044.64万股,占发行后总股本10%,计划募资42.02亿元。按市场预估市值超400亿元测算,发行价约104元/股,单签缴款约5.2万元,最终价格以询价结果为准。
字节 Seed 发布音视频全双工大模型 SeedRealtime,已在豆包 App 上线
字节 Seed 团队发布音视频全双工大模型 SeedRealtime,采用统一端到端架构,原生融合音频、视频与文本能力,支持“边看、边听、边说”的实时自然交互。该模型已在豆包 App 全量上线。相比传统“听、转写、思考、表达”的级联方案,SeedRealtime 将音视频感知与表达整合至同一模型,可直接接收画面和声音并生成回应,降低对话中抢话、突兀停顿和答非所问等节奏问题。
阿里通义千问上线 Qwen-Image-3.0-Pro,支持 10px 级文字渲染
阿里通义千问图像模型 Qwen-Image-3.0-Pro 与 Standard 已在 Qwen Cloud 上线。官方信息显示,Qwen-Image-3.0-Pro 在 Arena 文生图榜单中位列中国模型第一、主流模型第二,支持 4.5k-token 超长提示词、10px 级精细文字渲染及 12 种语言。价格方面,Pro 版单张起价 0.04 美元,Standard 版单张起价 0.03 美元。新模型将图像生成与编辑能力整合至同一模型,用户无需分别调用出图和改图模型。
阿里千问Qwen-Image-3.0上线并开放API,文生图0.18元/张起
8月5日,阿里巴巴千问图像生成模型Qwen-Image-3.0上线千问AI平台并向用户全量开放,旗舰版Pro和标准版Standard同步提供API,海外用户可通过Qwen Cloud接入。该模型支持最高4.5k token指令输入,可生成分镜、试卷、九宫格知识图等复杂版面,支持小字、LaTeX公式、人像细节和古画修复渲染,覆盖100余种艺术风格及12种语言。定价方面,Standard版1K/2K均为0.18元/张,Pro版1K为0.25元/张、2K为0.5元/张。