返回到找工地图

MOSS(模思智能)

复旦邱锡鹏团队孵化,专注情境智能的多模态大模型公司,MOSS-TTS 全球开源下载破200万次

50-99 人办公室或远程上海 · 徐汇区复旦系情境智能开源社区标杆
团队哲学

我们是谁

模思智能(MOSS)孵化于上海创智学院与复旦大学 OpenMOSS 团队,由复旦大学教授邱锡鹏担任首席科学家、其学生李世民担任联合创始人兼 CEO。团队从2023年那款破圈的开源中文大模型 MOSS 出发,逐步把能力从纯文本对话扩展到语音、音频、视觉等多模态的理解与生成,2025-2026年相继发布 MOSS-Speech、MOSS-TTS Family、MOSS-Transcribe-Diarize、MOSS-VL-Realtime 等模型,开源生态在 GitHub 获得超1万 Star,模型下载量超200万次。

我们相信什么

我们的核心差异化在于专注“情境智能”(Context Intelligence):AI 不该只理解输入的文字,而要理解信息发生时所处的真实情境——声音、画面、语气、情绪、人物关系等多维信息。当前的人机交互高度依赖键盘、鼠标等传统硬件,体验生硬割裂;情境智能的目标,是让 AI 充分理解完整场景,实现脱离传统硬件、无缝流畅、高度拟人化的交互。

我们分两步推进:第一步打磨语音理解与语音生成的核心能力;第二步是实时视频流理解,实现可打断、可主动发起对话的视觉交互。长期目标是把语音、视觉等全部模态整合进一套统一系统,完成完整的情境智能。

我们怎么做

商业化上我们采用 B端 + C端双轨并行:B端通过 MossAPI 以 MaaS 模式向企业开放底层原子能力;C端自研一站式 AIGC 创作平台 Mossland,以语音为核心,服务短剧配音、播客、短视频等内容创作场景。我们不局限于单一细分场景,核心是做全场景物理环境的统一建模——这是我们区别于其他大模型公司的长期壁垒。

Fun facts
  • 公司中文名“模思”就是“MOSS”的音译——那个2023年科幻感十足、登上微博热搜的开源中文大模型,团队直接把它变成了公司名

  • CEO李世民与唐太宗同名,本科尚未毕业就以第一作者身份在 CCF-A 类国际顶会发表3篇论文,还带队做过一款叫“学桥”的复旦内部跨学科协作平台

  • 首席科学家邱锡鹏大学最初专业不是计算机,是复旦的通识课让他“转行”;他后来写的《神经网络与深度学习》被称为“人工智能入门必读书”

  • WAIC 2026现场,团队搭了一个“声音巴别塔”装置——用任意语言或方言说话,塔身节点会实时点亮,用装置证明自己的跨语种语音理解能力

技术栈
  • MOSS-TTS Family:高表现力语音合成模型,支持复刻、长语音、对话、指令、音效全覆盖

  • MOSS-Transcribe-Diarize:多说话人转写模型,开源后登上 Hugging Face Audio-Text-to-Text Trending 榜第一

  • MOSS-VL-Realtime:实时视频流理解模型,支持实时画面识别、打断、主动发起对话

  • MOSS-Speech:“语音到语音”直接交互模型,无需文本中介,可在生成回答同时捕捉语调、情绪、笑声等非文字信号

  • 技术演进路径:SpeechGPT(离散化端到端语音)→ AnyGPT(语音/文本/图像/视频统一映射至离散 Token)→ MOSS-TTSD / MOSS-Speech / NEX 能动性模型体系

  • 开源生态:GitHub 超1万 Star,Hugging Face 累计下载超200万次

最近新闻
创始团队
李世民
Founder / CEO

邱锡鹏门下硕博连读弟子,SpeechGPT 主导者,2024年带队开发跨学科协作平台“学桥”

邱锡鹏
Chief Scientist / 联合创始人

复旦大学计算机学院教授、博导,国家杰出青年科学基金获得者,著有《神经网络与深度学习》

fancyteams.com / mosi
由 Bonjour! 驱动 · 本周更新