DeepSight · WAIC 企业业务洞察 Memo
上海模思智能科技有限公司
Shanghai Mosi Intelligent Technology Co., Ltd. · MOSI AI / OpenMOSS · 全模态大模型 / 情境智能 / 数字人与音视频生成
上海 · AIGC·多模态大模型 · 世博展览馆 H1-C1234(展位号来自输入线索,未独立核验,见第10章)· 资料截至 2026-07-17
研究评级
跟进 / 值得深挖
暂不进入价格与交易条件判断
置信度
风险等级
中–高
观察时间窗口
12–18个月
大白话讲:这是一家由复旦大学邱锡鹏教授团队(国内首个类ChatGPT开源大模型MOSS的作者)孵化的公司,做的是"能听、能看、能说、能生成音视频"的全模态大模型,卖点是"情境智能"——让AI不止会聊天,还能理解场景、记住上下文、生成配套的语音和视频内容,未来想切入数字人、智能座舱、具身机器人这些需要"多模态交互"的场景。它值得继续研究,是因为团队学术背景干净、技术执行力用一连串可独立核验的开源模型和技术报告证明了自己(不是只讲故事),也拿到了IDG资本、华为哈勃等机构数亿元的天使轮融资;但当前判断被一件事卡住——公司目前对外披露的商业化信息几乎为零:没有收入数字、没有客户名单、"头部客户合作"都是模糊表述,而它所在的应用层(比如做数字人生意的硅基智能)已经有公司做到年入超6亿元、正在冲刺香港IPO,模思智能能不能把技术声誉转化成同等量级的付费生意,目前还看不清楚。
商业本质 研发全模态基座大模型(对话、语音交互、音视频生成、多说话人识别),通过开源建立技术影响力和开发者生态,同时运营MaaS大模型开放平台向企业客户输出API能力,目标客户覆盖消费电子、智能汽车、具身智能、数字人/内容创作等需要多模态交互能力的B端场景。
吃的贝塔 吃的是"大模型能力从纯文本向语音/视觉/音视频全模态扩展"这条产业贝塔——数字人、智能座舱、具身智能等场景对"能理解情境、能生成多模态内容"的AI能力需求是真实且在增长的,硅基智能等下游应用公司已实现规模化收入本身印证了这条赛道的商业化可行性。
Alpha Alpha 指公司自身稀缺优势:模思智能的Alpha在于邱锡鹏团队在语音/多模态大模型上的先发学术积累(MOSS、SpeechGPT、AnyGPT均为国内同类技术的较早探索者),以及用"统一Token架构"处理多模态信息的差异化技术路线,加上2026年初高密度、可独立核验的开源发布节奏证明的工程执行力。 这是同类学术系创业公司短期内不易复制的起点,但尚未转化为可独立验证的规模化收入壁垒。
验证门槛 核心验证门槛是:在字节、阿里、百度、腾讯、Google、OpenAI等资源量级远超自身的巨头同层竞争,以及硅基智能等应用层玩家已规模化变现的挤压下,模思智能能否把"基座模型开源声誉"转化为可持续、可独立核验的B端付费规模,而不只是技术报告和"头部客户"的模糊表述。
事实 多源独立信息可交叉验证 推断 基于事实合理推导 判断 研究者综合研判 待确认 单一信源/公司自述/信息缺口

01它所在的产业大棋局与行业本质

先说结论
全模态大模型是AI能力从"纯文本对话"向"能听、能看、能说、能生成音视频"扩展的必经阶段,赛道本身真实且已有硅基智能这样年营收超6亿元、正冲刺港股IPO的下游应用玩家验证了商业化可行性;但模思智能目前站位在更上游的基座模型层,这一层的变现方式(开源+MaaS)尚未被证明能支撑同等规模的收入。

行业为何存在

过去两年国内大模型竞争已从"文本对话能力"逐步转向"多模态理解与生成能力"——语音交互、数字人、具身智能等场景都需要AI同时处理语音、图像、视频等多种信息并生成对应内容。传统方案是把语音识别(ASR)、对话模型、语音合成(TTS)三个独立模型串联起来,链路长、延迟高、误差累积;行业需要能原生处理多模态信息的统一模型。判断

细分成熟度

文本对话大模型已高度成熟(国内外均有多家规模化玩家);数字人/内容创作应用层也已进入成熟商业化阶段——硅基智能2024年按灼识咨询口径占国内数字人智能体市场份额32.2%,2025年11月已向港交所递交上市申请。相比之下,"全模态统一基座模型"(用同一套架构原生处理语音、文本、图像、视频)仍是相对早期、格局未定的子领域,国内外大厂与模思智能这类创业公司都在同一时间窗口探索。事实

价值链哪层更容易赚钱

下图为硅基智能(国内数字人智能体市场份额第一的下游应用层公司)2022–2024年营收趋势,用于标定这条价值链"应用层"目前已能支撑的成熟收入规模。模思智能目前站位在更上游的"基座模型+MaaS"层,这一层的商业化验证(详见第4章)目前仍停留在开源声誉与平台公测阶段,尚未看到同等量级的独立收入披露。

参照:数字人智能体市场份额第一的硅基智能年营收趋势,2022–2024(亿元人民币) 0亿元 2亿元 4亿元 6亿元 8亿元 2.23亿元 5.31亿元 6.55亿元 2022财年 2023财年 2024财年 硅基智能2022–2024年营收从2.23亿元增至6.55亿元,2025年11月已向港交所递交上市申请。 数据来源:21经济网、东方财富网转引硅基智能招股书,访问日期2026-07-17。 此图仅标定数字人应用层成熟收入规模,不代表2024年成立且未披露审计收入的模思智能。 每个图元已绑定数据表编号(data-dp),可脱离人工重新核验
图1 · 参照:硅基智能2022–2024年营收趋势,用于标定应用层已能支撑的成熟收入规模

真正兑现经营结果的是谁

目前看,真正把多模态AI能力转成规模化收入的,是像硅基智能这样同时具备"应用场景落地+供应链/渠道集成+多年客户沉淀"的下游公司;模思智能作为2024年11月成立的基座模型层新进入者,商业化验证目前主要体现为开源发布的技术声誉和"头部客户合作"的模糊表述,而非独立审计的年度收入。判断

当前结论:模思智能所在的全模态赛道本身真实且已获资本市场部分验证(硅基智能冲刺IPO),但价值链上真正稳定赚钱的是下游应用层,模思智能所在的基座模型层商业模式仍待验证。反转条件:若模思智能MaaS平台披露独立可核验的调用量/收入增长数据,应上调判断。

02创始人与团队

先说结论
首席科学家邱锡鹏在NLP与大模型领域的学术声誉是公开、可交叉验证的重量级事实;CEO李世民出自邱锡鹏门下、主导过SpeechGPT等技术成果,学术背景过硬,但其独立带队商业化、规模化运营公司的经验目前未见公开披露,是团队维度最大的待核证点。
邱锡鹏 · 首席科学家
复旦大学教授 · 国家杰出青年科学基金获得者 · 2024年CCF-ACM AI Award获得者
国内NLP与大模型领域的代表性学者,2023年带领团队发布国内首个开源中文对话大模型MOSS,此后主导SpeechGPT(国内首个离散化端到端语音交互模型)、AnyGPT(全模态统一映射模型)等研究。多家媒体(投资界、36氪、新京报等)均独立报道其作为模思智能首席科学家的身份,属可交叉验证事实。事实
李世民 · CEO
邱锡鹏门下硕博连读体系出身 · CCF-A类国际会议第一作者(三篇论文)
创业前主导推出SpeechGPT,打破传统"语音识别→对话模型→语音合成"三级串联架构,实现语音输入到语音输出的直接交互;深度参与科技部"新一代人工智能2030"重点研发项目。公开报道仅见于新京报一篇融资报道,属单一信源,其学术成果本身可通过论文交叉验证,但担任CEO的商业化管理经验未见独立披露。待确认(单一信源:新京报)
团队规模与构成
近百人全栈技术体系 · 博士占比接近50%
核心成员主要来自复旦大学NLP/MOSS技术体系,同时引入阿里、字节、理想汽车等背景的产业工程化人才,体现"学术研究+产业落地"的团队搭配意图。事实(投资界、36氪等多源交叉报道团队规模与构成描述基本一致)
孵化机构支持
上海创智学院 + 复旦大学联合孵化
获得覆盖算力、人才与产业资源的体系化支持,公司多篇技术发布(MOSS-Transcribe-Diarize、MOVA等)均通过上海创智学院官网首发,显示孵化机构在技术传播渠道上的深度参与。事实

团队为何适配这件事

核心团队在语音大模型、多模态大模型领域有连续多年的学术研究积累(MOSS→SpeechGPT→AnyGPT一脉相承),技术方向与公司"全模态基座模型"业务高度对口,不属于跨界追风口型创业。判断

带队规模化能力

公开资料未见CEO李世民或核心团队此前有大规模商业化公司管理经验的独立披露;公司当前的组织能力主要体现在高强度、可核验的技术发布节奏上(见图2),而非已验证的商业化团队运营能力。待确认

明确短板与待核证点

(a) 除邱锡鹏、李世民外,其余核心团队成员的具体职责、任职时间、股权结构公开披露有限;(b) 公司完整股权结构、注册资本、法定代表人等工商登记信息,本次研究通过多个企业信息查询渠道均未能成功抓取,标记为信息缺口;(c) 团队学术背景突出,但产业侧销售、商务拓展、客户成功等商业化职能团队的规模和背景披露几乎为零。待确认

当前结论:团队学术背景可信度高、技术方向高度对口,但商业化组织能力和完整股权结构是尚未被验证的最大变量。反转条件:若观察到具备产业化/规模化管理经验的商业化高管加入,应上调团队维度判断。

03产品、技术与真实需求

先说结论
模思智能的技术真实性相对可信——多个模型(MOSS-Transcribe-Diarize、MOVA)均有对应的arXiv技术报告和开源权重代码可供独立核验,这与许多"只讲故事"的创业公司不同;但性能对比数据(如"优于GPT-4o、Gemini")来自公司自测benchmark,尚未见独立第三方评测复现,需求真实性也仍处早期验证阶段。

解决什么问题 / 替代什么旧方案

MOSS-Transcribe-Diarize针对的是传统语音识别在长音频、多说话人重叠场景下的失效问题——公司自测称GPT-4o、Gemini等模型"无法可靠地处理"90分钟级长音频输入,而MOSS-Transcribe-Diarize通过128K长上下文窗口和统一端到端架构同时完成语音识别、说话人识别和时间戳预测。MOVA、MOSS-TTS Family则试图替代传统"文本→单独配音→单独视频剪辑"的分步内容生产流程,实现音画同步生成。判断

技术真实性

与许多仅靠专访自述的创业公司不同,模思智能的核心技术均发布了可独立核验的技术报告:MOSS-Transcribe-Diarize对应arXiv 2601.01554,MOVA对应arXiv 2602.08794,且MOVA已"将模型权重、训练代码、推理代码以及微调方案进行全栈开源"。这意味着技术真实性本身(模型确实存在、确实具备所述架构)可被第三方独立复现验证,而非停留在公司口头表述层面。但公司自测的性能对比数据(相对GPT-4o、Gemini 3 Pro、LTX-2、OVI等竞品的胜出结论)仍需第三方独立评测交叉验证。事实(技术报告与开源代码存在性)/ 待确认(自测benchmark结论的独立验证)

需求真实性与兑现边界

长音频会议转录、播客/影视配音、数字人交互等场景的需求是真实存在的行业痛点,但模思智能相关模型(MOSS-Transcribe-Diarize发布于2026年1月21日、MOVA发布于2026年1月29日、MOSS-TTS Family发布于2026年2月11日)均为近期发布,公开资料中未见任何独立第三方用户规模、留存或复购数据,产品市场契合度目前只能从"开源社区反馈"和"某电商品牌测试期日均调用量"等零散信号间接推测,尚无法独立验证。待确认

技术路线特点

公司采用"统一Token架构"处理多模态信息,即用同一套离散Token体系表征语音、文本、图像、视频,区别于主流"纯文本大模型外挂多模态编码器"的方案;这一路线选择被管理层描述为"较少人走的道路",需要更早识别并押注下一代智能的核心结构来建立护城河。判断(管理层表述,来自36氪专访)

当前结论:技术真实性有开源代码和技术报告支撑、相对可信,是本报告置信度"中"而非"低"的主要原因;但需求真实性和自测benchmark的独立验证仍是空白。反转条件:若出现独立第三方技术评测复现自测benchmark结论,或披露正式上线后的用户规模/留存数据,应上调需求真实性判断。

04商业模式、客户与落地证据

先说结论
商业模式是"基座模型全栈开源建立技术影响力 + MaaS开放平台向B端输出API能力"的两层打法,公司自述已在消费电子、智能汽车、具身智能、AI陪伴场景与"头部客户"合作,但截至研究完成,未能找到任何具体客户名称、合同金额或收入规模的独立可核验披露。

商业模式

公司自述商业化路径为"词元的生产、分发与应用"三级飞轮:(1) 通过全栈开源模型权重、训练代码建立技术声誉和开发者生态;(2) 运营MaaS多模态大模型开放平台(当前处于全面公测阶段),向企业客户提供API能力;(3) 覆盖2B、2B2C、2C多层级场景,目标是"从基座模型到垂直应用的一体化能力构建"。事实(36氪专访管理层表述)

谁使用、谁付钱:合作表述 vs 真实付费证据

公司自述"头部客户合作"场景
36氪专访提及公司已在消费电子、智能汽车、具身智能与AI陪伴等场景与"头部客户展开合作",但具体客户名单、合作性质(技术测试/POC试点/正式商业付费)、收入贡献均未披露。待确认(单一信源,且为模糊表述,非具名客户案例)
国产算力生态合作
MOSS-TTS Family已实现"壁仞科技壁砺™166M的Day-0高性能推理部署支持"——这是相对具体、可交叉验证的技术生态合作,但属于基础设施层面的技术适配,不等同于下游客户的商业化付费。事实
真实付费信号
公开资料中未找到任何模思智能对外披露的合同额、API调用量、付费客户数或收入数字。相比同赛道硅基智能已披露具体的营收数字(2022–2024年2.23→6.55亿元)与客户案例("超5000家合作品牌"、"超30家银行/保险公司"),模思智能的商业化验证目前是空白。待确认

如何交付

目前主要交付形式为:(a) 模型权重、训练代码、推理代码的开源发布(GitHub/模型社区);(b) API接口开放(部分模型标注"限时免费期",如MOSS-Transcribe-Diarize);(c) MaaS开放平台的企业级API输出(公测阶段)。事实

复制条件

依赖:(a) 持续的高质量开源发布维持技术声誉和开发者生态活跃度;(b) MaaS平台从"公测"顺利过渡到"规模化付费",需要证明API的稳定性、成本效益优于自建或采购GPT-4o/Gemini等海外API;(c) 在具体垂直场景(数字人、智能座舱等)建立不依赖单一客户的多元化付费客户群。判断

当前结论:商业模式逻辑自洽、技术生态合作(如壁仞科技)相对具体可信,但核心的B端付费客户与收入数据目前是完全空白,这是本报告风险等级"中–高"的直接原因。反转条件:若披露具名客户案例及可交叉验证的合同额/收入数据,应上调商业化落地判断。

05竞争与替代关系

先说结论
模思智能面对的是双重挤压:同层的全模态基座模型竞争中站着字节、阿里、百度、腾讯、Google、OpenAI等资源量级远超自身的巨头;下游应用层已有硅基智能这样的成熟玩家占据主要收入份额。模思智能的差异化定位是"情境智能+统一Token架构"的技术路线选择,而非规模或资源优势。
硅基智能
2017年成立,腾讯、红杉等投资,2024年按灼识咨询口径占国内数字人智能体市场份额32.2%第一,累计向电信、金融、政府等行业提供超8万个"数字人劳动力",2022–2024年营收2.23→6.55亿元,2025年11月递交港股IPO申请。是数字人/内容应用层的规模化标杆,模思智能与其究竟是竞争关系、潜在客户关系还是合作关系,目前未有公开信息说明。事实
国内大厂多模态大模型(字节豆包、阿里通义、百度文心、腾讯混元等)
均在推进语音交互、多模态理解与生成能力建设,资源投入(算力、人才、分发渠道)远超模思智能这样的早期创业公司;模思智能选择"情境智能"这一细分定位与统一Token技术路线作为差异化,但大厂同样具备快速跟进任何被验证有效的技术路线的能力。判断
国际同类模型(GPT-4o、Gemini 3 Pro、Sora 2、Veo 3、LTX-2、OVI等)
模思智能在自测benchmark中称MOSS-Transcribe-Diarize在长音频场景优于GPT-4o、Gemini 3 Pro,MOVA在口型同步与音画同步指标上优于LTX-2、OVI、WAN2.1+MMAudio等开源竞品;但这些结论均为公司自测,尚未见独立第三方评测复现(见第3章)。待确认(自测benchmark结论)
"不采购/自建"选项
对预算充足的大型企业客户而言,直接采购GPT-4o、Gemini等海外成熟API,或基于开源模型自建团队二次开发,都是不采购模思智能MaaS平台的现实替代选择;对中小客户而言,继续使用现有更成熟的数字人/内容生成SaaS工具也是选项。判断

下图展示模思智能在"全模态AI价值链"中的位置——它目前站在基座模型与MaaS平台这一中间层,上有资源占优的大厂同层竞争,下有硅基智能等已规模化变现的应用层玩家,模思智能与应用层玩家之间是竞争还是潜在客户关系,是本报告第9章的重点尽调问题之一。

模思智能在全模态AI价值链中的位置:基座模型层 vs 应用变现层 定性判断,非数值测算——基于公开报道对产业分工的归纳 上游 · 基础技术组件(模思智能自研) SpeechTokenizer / MOSS-Audio-Tokenizer(音频离散化编码)+ 统一Token架构 区别于主流纯文本大模型路线,用统一Token同时表征语音/文本/图像/视频 中游 · 全模态基座模型 + MaaS开放平台(模思智能当前所在层) MOSS系列:对话(MOSS)、语音交互(SpeechGPT)、全模态(AnyGPT)、语音生成(MOSS-TTS Family)、 音视频生成(MOVA)、多说话人识别(MOSS-Transcribe-Diarize);定位"情境智能"——持续感知/动态记忆/环境理解 ⚠ 同层还站着字节豆包、阿里通义、百度文心、腾讯混元、Google Gemini、OpenAI等资源量级远超模思智能的巨头 变现方式:模型权重全栈开源 + MaaS API开放平台(公测阶段,尚未披露调用量/付费数据) 国产算力生态:壁仞科技壁砺™166M Day-0推理部署支持 数字人/内容创作应用层 硅基智能(市场份额32.2%第一) 魔珐 / 追一科技 / 世优科技 已规模化收入(硅基智能2024年6.55亿元) 见图1;与模思智能关系(竞争/ 客户/合作)尚未明确,见第9章C2 垂直场景应用层 消费电子 / 智能汽车 / 具身智能 / AI陪伴 模思智能自述已与"头部客户" 展开合作,具体名单、合作性质 及收入贡献均未披露(待确认) 价值链提示:真正兑现收入的一层目前不是模思智能所在的一层 硅基智能等下游应用层玩家已有审计口径的规模化收入(2022–2024年2.23→6.55亿元,见图1); 模思智能目前的商业化验证仍停留在"基座模型开源声誉 + MaaS平台公测"阶段,尚无独立收入数字 → 核心验证门槛:能否把中游技术声誉转化为下游可核验的付费规模,而非停留在开源影响力
图2 · 模思智能在全模态AI价值链中的位置(定性判断,非数值测算)
当前结论:模思智能的差异化定位(情境智能+统一Token架构)逻辑自洽、技术执行力可信,但同时面对上游巨头资源挤压和下游应用层成熟玩家的双重竞争压力,护城河深度仍待观察。反转条件:若模思智能在MaaS平台商业化或某一垂直场景(如具身智能)建立起可披露的独家规模化合作,应上调竞争位置判断。

06关键争议

先说结论
三个真正影响判断的争议:技术开源声誉能否转化为MaaS付费收入、"情境智能"差异化定位能否抵御巨头资源碾压、学术团队能否补齐商业化能力短板。三者都尚无定论,是本轮研究评级"跟进而非优先跟进"的直接原因。

争议一:高强度开源发布建立的技术声誉,能否转化为MaaS平台的规模化付费收入?

乐观情景持续的高质量开源发布吸引大量开发者关注和试用,MaaS平台凭借技术口碑和国产算力适配(如壁仞科技)优势,从"限时免费"公测阶段平滑过渡到规模化付费,尤其在国产化替代需求下获得B端客户青睐。
悲观情景开源模型的"技术声誉"和"付费意愿"是两回事——开发者可能只使用免费开源权重自行部署,而非通过模思智能的MaaS平台付费调用API;大厂同类API价格竞争和渠道优势可能进一步压缩模思智能MaaS平台的定价空间。
现实基准目前仅有"限时免费"和"全面公测"的表述,未见任何API调用量、转化率或收入数字的披露,两种情景哪个更接近现实无法判断。
当前判断:开源声誉与商业化收入之间的转化路径目前完全没有数据支撑,是本轮研究"跟进而非优先跟进"的核心原因之一。

争议二:"情境智能"差异化定位能否在巨头同层竞争中站稳,还是会被资源碾压?

乐观情景"统一Token架构"和"情境智能"是相对早期识别、尚未被巨头充分验证的技术路线,模思智能凭借先发学术积累和更聚焦的产品定义,有机会在细分场景(如具身智能交互)建立起大厂短期内难以复制的技术领先。
悲观情景一旦"统一Token"或"情境智能"被验证为有效方向,字节、阿里、Google、OpenAI等巨头凭借远超模思智能的算力、数据和人才资源,可以在更短时间内复制甚至超越同等技术效果,模思智能的先发优势窗口可能被迅速压缩。
现实基准目前模思智能的技术优势主要体现在公司自测benchmark中,尚未看到独立第三方评测或市场份额数据支撑"领先"的实际含金量。
当前判断:技术路线差异化存在,但受巨头资源碾压风险的挤压,其可持续时间是决定研究评级能否上调的关键变量。

争议三:以学术研究见长的团队,能否补齐商业化、规模化运营的短板?

乐观情景团队已主动引入阿里、字节、理想汽车等产业背景的工程化人才,显示出补齐商业化短板的自觉意识;充裕的天使轮资金也为组建专业商业化团队提供了资源基础。
悲观情景学术团队向商业化组织转型是许多"教授系"创业公司的共性难题——从"发论文、开源模型"到"跑通规模化销售、客户成功"需要完全不同的能力体系,CEO本人此前也未见独立披露的商业化管理经验。
现实基准目前公开资料未披露公司商业化/销售团队的具体规模和背景,无法判断转型进度。
当前判断:团队补齐商业化短板的意愿有迹可循(引入产业人才),但实际执行效果尚无数据验证。

07决定成败的因果链

先说结论
链条起点是邱锡鹏团队的学术声誉与高强度开源执行力,中间需要经过"MaaS平台付费转化"这一尚未验证的关键断点,终点才是可持续的规模化收入与后续融资。目前链条在前段(学术声誉→开源发布→资本关注→融资到账)已基本验证,后段(MaaS商业化→规模化收入)完全是空白。
1邱锡鹏团队的学术声誉(MOSS等成果)与复旦大学/上海创智学院孵化背景建立初始信任
关键变量:核心人物学术影响力的可持续性(当前高度依赖邱锡鹏个人,见第8章风险三)
22023–2026年高强度、可独立核验的模型开源发布节奏(见图2数据),证明团队工程执行力
传导机制:技术报告+开源代码的存在,把"信任"从"相信人"升级为"可验证的技术产出"
3技术执行力吸引IDG资本、华为哈勃投资等顶级机构关注,2026年4月完成数亿元天使轮融资
值得注意:高密度开源发布(2026年1-2月)早于融资官宣(2026年4月),执行节奏可能是吸引本轮资本的因素之一
4融资资金支撑团队扩张与MaaS开放平台建设,平台进入全面公测阶段
当前所处环节:MaaS平台公测中,尚未披露调用量/转化率数据
⚠ 断点风险①:若MaaS平台无法从"公测"过渡到"规模化付费",商业化验证将持续空白(见第6章争议一)
5(尚未发生)B端客户付费规模化,形成独立可核验的收入数字
对照:硅基智能等应用层玩家已实现年营收超6亿元级别的规模化收入(见图1)
⚠ 断点风险②:若字节、阿里等巨头在同层技术路线上快速跟进,模思智能的差异化窗口可能被压缩(见第6章争议二)
6(尚未发生)规模化收入支撑后续融资,形成"技术声誉→商业化→资本"的正向循环
长期目标:从"基座模型开源影响力"转化为可持续经营的商业实体
当前结论:因果链条前四步(学术声誉→开源执行力→融资到账→平台公测)基本闭环验证,但第5步(B端规模化付费)和第6步(正向循环)完全尚未发生,是当前研究评级"跟进而非优先跟进"的核心原因。反转条件:若观察到MaaS平台调用量/收入数据首次披露,或出现具名B端付费客户案例,因果链条的可信度应显著上调。

08风险与预警信号

先说结论
风险等级中–高,三条主要传导链分别指向商业化验证空白、巨头资源挤压、关键人依赖,均有明确的可观察信号与反转条件。
风险一:商业化验证空白风险
传导链:MaaS平台长期停留在"公测/限时免费"阶段 → 无法证明API的规模化付费需求 → B端客户可能转向更成熟的大厂API或应用层SaaS工具 → 商业化数据持续缺失可能影响后续融资进程的顺利推进
可观察信号:MaaS平台是否首次披露调用量、付费客户数或收入数字
反转条件:若披露具名B端付费客户案例及可交叉验证的收入数据,可部分对冲
风险二:巨头资源挤压风险
传导链:字节、阿里、百度、腾讯、Google、OpenAI等在同层全模态大模型上投入远超模思智能的算力与人才资源 → 一旦"情境智能"或"统一Token"路线被验证有效,大厂可快速复制甚至反超 → 模思智能的技术领先窗口被压缩 → 差异化定位失效
可观察信号:是否有大厂推出对标"情境智能"定位或统一Token架构的同类产品
反转条件:若模思智能率先在某一垂直场景(如具身智能)建立独家规模化合作,可部分对冲
风险三:关键人依赖风险
传导链:公司核心技术声誉和融资叙事高度绑定邱锡鹏个人学术声誉及复旦MOSS体系 → 若邱锡鹏教职、学术重心或对公司投入精力发生变化 → 公司技术传播渠道和资本市场信任基础可能受到影响;同时CEO商业化经验未经验证,团队治理结构透明度有限(公司完整股权结构未能独立核验)
可观察信号:邱锡鹏在公司的全职/兼职身份是否有更清晰的公开披露;核心高管股权结构是否透明化
反转条件:若披露更完整、透明的股权结构和治理信息,可部分对冲
当前结论:三条风险均处于"潜在但未证实已实质冲击经营"的阶段,商业化空白和巨头挤压是权重最高的两条。反转条件:见各风险行的"反转条件"列。

09重点尽调问题

先说结论
10个高杠杆问题分为商业化真实性、团队与治理、竞争位置、技术与数据真实性四组,直接对应第6章三个争议与第8章三条风险的验证需求。

如果只能问三个问题

  1. MaaS多模态大模型开放平台自2026年公测以来的实际API调用量、付费转化率及收入规模是多少?
  2. CEO李世民此前是否有独立可查的商业化公司管理或规模化团队运营经验?
  3. 字节跳动豆包、阿里通义、百度文心、腾讯混元等大厂同类多模态语音/音视频生成能力的商业化投入与模思智能相比处于什么量级?
A组 · 商业化真实性
A1. MaaS多模态大模型开放平台自2026年公测以来的实际API调用量、付费转化率及收入规模是多少?
为什么问:目前公开资料对公司商业化数据完全没有披露,这是判断公司能否从"技术声誉"走向"可持续经营"的最核心证据。
需要证据:API调用量趋势、付费客户数、收入规模,理想情况下附带第三方核验说明。
会改变判断:若披露持续增长的调用量/收入数据,上调评级;若长期无披露或数据停滞,需下修商业化落地判断。
A2. 公开表述中"消费电子、智能汽车、具身智能、AI陪伴场景的头部客户合作",具体客户名单及合作性质分别是什么?
为什么问:"头部客户合作"是当前唯一的商业化信号,但表述模糊,需要具体化才能评估含金量。
需要证据:具名客户案例、合作阶段(技术测试/POC/正式付费)、合同规模。
会改变判断:若为具名头部客户的正式付费合作,上调商业化判断;若仅为技术测试阶段,维持谨慎。
A3. 天使轮"数亿元人民币"融资的具体到账金额、资金使用计划及当前资金消耗速度是多少?
为什么问:公开报道对融资金额均为区间性描述,需要更精确的信息判断公司的资金储备和抗风险能力。
需要证据:融资到账时间、资金使用计划的公开披露。
会改变判断:资金储备充裕且使用计划清晰,上调组织稳定性判断。
B组 · 团队与治理
B1. CEO李世民此前是否有独立可查的商业化公司管理或规模化团队运营经验?
为什么问:当前公开报道仅披露其学术成果,商业化管理经验是团队维度最大的信息缺口。
需要证据:此前任职经历、管理团队规模的独立信源佐证。
会改变判断:若有独立佐证的商业化经验,上调团队判断;若确认完全无相关经验,需下修。
B2. 公司完整股权结构、注册资本、实际控制人及邱锡鹏本人在公司的具体持股/任职身份是什么?
为什么问:本次研究通过多个企业信息查询渠道均未能成功抓取公司工商登记信息,是显著的信息缺口。
需要证据:工商登记信息、股权结构图。
会改变判断:治理结构透明清晰,上调团队与治理判断;若发现异常股权结构,需下修。
B3. 近百人团队中,技术研发与产品/商务/销售岗位的人员占比分别是多少?
为什么问:判断公司是否已具备与"MaaS商业化"目标匹配的组织能力,而非纯研究型团队。
需要证据:公司官方或工商登记的部门人员分布。
会改变判断:商业化职能占比合理提升,上调组织能力判断。
C组 · 竞争位置
C1. 字节跳动豆包、阿里通义、百度文心、腾讯混元等大厂同类多模态语音/音视频生成能力的商业化投入与模思智能相比处于什么量级?
为什么问:这是判断模思智能差异化窗口能维持多久的关键外部变量。
需要证据:大厂相关业务线的公开投入、团队规模、产品发布节奏对比。
会改变判断:若大厂投入远超且已有同类产品规模化,需下修竞争位置判断;若大厂尚未重点布局,维持评级。
C2. 模思智能与硅基智能等数字人应用层公司是潜在竞争关系、客户关系还是合作关系?其MaaS平台是否已被应用层公司采购调用?
为什么问:价值链上下游关系不明确,直接影响对模思智能未来收入来源的判断。
需要证据:是否有应用层公司公开表示采购或测试模思智能API的报道。
会改变判断:若确认为供应商关系且已有采购案例,上调商业化路径清晰度判断。
D组 · 技术与数据真实性
D1. MOSS-Transcribe-Diarize、MOVA等模型在权威第三方评测榜单(而非公司自测benchmark)上的实际排名如何?
为什么问:当前所有性能优势结论均来自公司自测,缺少独立验证。
需要证据:第三方权威评测榜单(如Hugging Face开源榜单、独立学术评测)的排名数据。
会改变判断:若第三方评测证实自测结论,上调技术真实性判断;若差距明显,需下修。
D2. 开源发布的MOVA、MOSS-TTS Family等模型被第三方项目/产品实际集成调用的数量与活跃度如何?
为什么问:开发者生态活跃度是判断"技术声誉"是否真实转化为影响力的关键间接指标。
需要证据:GitHub star数/fork数、模型社区下载量、被集成的下游项目案例。
会改变判断:生态活跃度高,上调技术影响力判断;活跃度低,需重新评估开源策略的实际效果。

10来源与口径

主要公开来源

投资界《模思智能完成数亿元天使轮融资,复旦大学邱锡鹏教授团队孵化》
https://news.pedaily.cn/202604/562313.shtml
访问日期 2026-07-17
36氪《重磅!复旦邱锡鹏公开创业路线:从语音切入押注"情境智能",天使轮已融资数亿元》
https://eu.36kr.com/zh/p/3740809089826819
访问日期 2026-07-17
新京报《全模态基座模型公司模思智能完成数亿元天使轮融资》(含CEO李世民信息)
https://m.bjnews.com.cn/detail/1775013217129133.html
访问日期 2026-07-17
上海创智学院《击败GPT、Gemini,创智×复旦孵化创业团队「模思智能」,语音模型上新了》(MOSS-Transcribe-Diarize发布)
https://www.sii.edu.cn/2026/0127/c27a664/page.htm
发布日期 2026-01-27 · 访问日期 2026-07-17
上海创智学院《创智+模思发布开源版Sora2,电影级音视频同步生成,打破闭源技术垄断》(MOVA发布)
https://www.sii.edu.cn/2026/0130/c27a672/page.htm
发布日期 2026-01-30 · 访问日期 2026-07-17
腾讯新闻(机器之心)《复刻、长语音、对话、指令、音效全覆盖!模思智能推出MOSS-TTS Family!》
https://news.qq.com/rain/a/20260211A055QK00
发布日期 2026-02-11 · 访问日期 2026-07-17
arXiv《OpenMOSS MOVA: Towards Scalable and Synchronized Video–Audio Generation》技术报告
https://arxiv.org/abs/2602.08794
访问日期 2026-07-17
21经济网《硅基智能递交港股IPO,8万个数字人今年开始赚钱了》
https://www.21jingji.com/article/20251107/herald/e6e9d69e3f5d935e3f3b98d8b705452e.html
发布日期 2025-11-07 · 访问日期 2026-07-17
东方财富网《硅基智能递交港股IPO 8万个数字人今年开始赚钱了》(营收数据来源)
https://finance.eastmoney.com/a/202511073557660656.html
访问日期 2026-07-17
LMG 2025《模思MOSS-Speech介绍》(会议赞助商页面,团队与产品背景)
http://lmg.cipsc.org.cn/conference/lmg2025/sponsor/MOSS/index.html
访问日期 2026-07-17
世界人工智能大会(WAIC)官网 — 确认2026年7月17–20日于上海世博展览馆举办
https://www.worldaic.com.cn/
访问日期 2026-07-17

矛盾口径与信息缺口

存在两家同名"上海模思智能科技有限公司":本报告研究对象是复旦大学邱锡鹏教授团队孵化的全模态大模型公司;另有一家同名公司为专注端侧AI/高通平台边缘计算的智能制造解决方案服务商(官网mossland.studio),二者业务完全不同。本报告已根据输入线索中的业务特征(多模态大模型、情境智能、数字人、音视频理解生成)核对确认研究对象为前者,但两家公司是否存在关联(如曾用名、分立关系)未能独立核实,标记为待确认。
融资领投方表述在不同信源间存在差异:部分报道称"上海未来产业基金、IDG资本"联合领投,另有报道称"IDG资本"单独领投;跟投方名单在不同报道中也略有出入(是否包含"安信信托"、"某头部产业投资方"等表述不完全一致)。融资金额均为"数亿元人民币"的区间性描述,未见披露精确金额,本报告不对具体金额做精确化推测。
公司完整工商注册信息(注册资本、法定代表人、股权结构、参保人数)本次研究通过企查查、天眼查、爱企查等多个公开查询渠道均未能成功抓取页面内容,标记为信息缺口。
MOSS-Transcribe-Diarize、MOVA等模型的性能对比数据(相对GPT-4o、Gemini 3 Pro、LTX-2、OVI等竞品的优势结论)均来自公司自测benchmark及技术报告摘要,本报告未能获取完整技术论文正文交叉核验具体数值细节,仅确认技术报告与开源代码的存在性本身为事实。
WAIC 2026展位号"H1-C1234"来自本次研究收到的输入线索,未在公开可检索的WAIC官方展商名录中独立交叉验证;本报告不对该展位信息的准确性做背书,仅作为公司参展该届WAIC的识别性描述保留。
未检索到与模思智能相关的重大诉讼、监管处罚或负面舆情事件的公开报道。