Skip to content

0.1B的“大”模型,还是全模态!这能用吗?

前言

最近我在刷抖音时,偶然看到了这样一个模型。参数量小的可怜——只有0.1b!要知道就连RAG用的嵌入模型有些都有0.6b了(如qwen3-Embedding-0.6b),我想,这幻觉得有多大啊?毕竟0.8b的大模型就很“笨”了。

屏幕截图 2026-08-14 180045

如图。我让此模型帮我规划四人份的早餐,而它给出的答案可以说与早餐毫不相关!真的会有人早餐吃这么硬核的东西吗?

折腾过程

言归正传,这个模型其实叫 MiniMind-O ,这里给出Github仓库链接。

jingyaogong/minimind-o

这个项目出自 jingyaogong 之手,是他 MiniMind 系列的第三站:先是 MiniMind(纯文本 LLM),再是 MiniMind-V(视觉多模态),最后是 MiniMind-O(听、说、看、想的全模态)[1]。所谓 Omni,就是单一权重同时接收文本、语音、图像输入,输出文本和流式语音——也就是 GPT-4o 那种形态,只不过把 0.1B 的骨架塞了进去。项目在 2026 年 5 月 5 日开源,发布时 GitHub 上已经有 2.3k star、266 fork[2],还附带了一篇技术报告[3],属实是”麻雀虽小,五脏俱全”。

既然它自称”CPU 即可快速推理”,那我这个只有核显、没有独显的电脑就有用武之地了。我当时的心理预期是:反正就 0.1B,跑不起来就当看个乐子。

装起来:比想象中顺利

克隆仓库、装依赖、下权重,一套流程走下来倒是没遇到什么大坑。它需要下载的东西不少:

  • 主模型权重 sft_omni_768.pth(约 236MB)
  • 语音编码器 SenseVoice-Small(约 469MB)
  • 视觉编码器 SigLIP2(约 189MB)
  • 音频编解码器 Mimi(约 192MB)
  • 说话人编码器 CAMPPlus(约 14MB)

加起来约 1.1GB,从 ModelScope 下载(国内速度很快)[4]。值得一提的是,这些”编码器”都是冻结的外部旁路模块——它们负责把语音、图像变成模型能懂的”语言”,以及把模型生成的音频码流还原成声音,但并不参与模型主体的训练。所以严格来说,MiniMind-O 的 0.1B 只是”可训练主体”,运行时要全部加载的话,大约是 538MB 参数(113M 主体 + 425M 冻结模块)[3]。这就是它敢叫”0.1B”又敢自称”全模态”的底气所在。

这里不得不提一嘴,此项目README.md中的第0步 1’环境准备相关内容。

1
2
3
4
# 克隆仓库代码
git clone --depth 1 https://github.com/jingyaogong/minimind-o
# 安装必要依赖
pip install -r requirements.txt -i https://pypi.tuna.tsinghua.edu.cn/simple

注意到作者使用了清华大学的tuna镜像源,此举可以大幅增加下载速度,在此可以看出作者很用心。

实测:文本问答,时灵时不灵

装好之后先用命令行跑了官方的评测脚本,7 个中文问题挨个问了一遍。结果嘛……只能说符合预期。

先看看表现还行的:

问:如何制作一杯咖啡?
答:制作一杯咖啡需要以下步骤:

  1. 准备咖啡粉和水,将咖啡粉放入咖啡壶中,加入适量的热水,等待约5分钟,然后用过滤器过滤咖啡粉和水,让咖啡渗透到杯子里。
  2. 把过滤器放入咖啡杯中,将热水倒入杯中,等待几分钟。
  3. 等待几分钟,让咖啡充分渗透到杯子里。
  4. 加入适量的咖啡粉,根据个人口味调整。
  5. 搅拌均匀,即可

看起来还挺好的

再感受一下翻车的:

问:告诉我一个关于太空的有趣事实。
答:太空中没有重力,所以没有重力。

……嗯,第一句是对的,第二句是对第一句的复读。这很”小模型”。

问:介绍一下你自己
答:作为一个AI语言模型,我没有自己,因为我是由计算机程序运行的。我被设计用于回答问题、提供信息、进行对话和执行任务。我没有自己,因为我没有自己。

“我没有自己,因为我没有自己”——莫名有点哲学,又莫名有点好笑。这大概是 0.1B 模型对”自我意识”的终极回答。

还有几个中规中矩的:

  • 今天天气怎么样? → “今天的天气情况取决于您所在的地区。”(正确但说了等于没说)
  • 明天会下雨吗? → “我无法确定,需要更多的信息才能回答这个问题。”(这个回答相当体面)
  • 讲个笑话 → “为什么秃顶的人会喜欢糖果?因为他们喜欢’糖果’!”(谐音梗,勉强算个笑话)

总体观感:不稳定——这是 0.1B 模型最核心的性格。同一个问题,换个问法、换个时间问,答案就飘。比如”1加1等于几”,我这边问它倒是答出了”等于2”,但解释部分开始胡言乱语:”将第一个数字1和第二个数字2相加,得到了两个数字1和数字2”——而有的朋友实测同一个问题,它直接答错。一个 1+1 都能时对时错,知识问答就更不用说了:0.1B 的脑子里装不下多少事实,问”海水为什么是咸的”这种问题,它会给你编出一套”阳光反射导致咸味”的伪科学[3]。这就是小模型的宿命:会说话,但知识少,且不稳定

它是真的会”说”!!!

但!MiniMind-O 最骚的地方不在文本,而在语音。这玩意儿是端到端的——它不是”语音转文字→LLM 回答→文字转语音”三级串联,而是让语音和文本在模型内部直接打通[3]。

架构上它分成两条路:

  • Thinker(思考者,约 64M):负责理解输入,生成文本回复——就是普通的 LLM 主干
  • Talker(说话者,约 47M):负责把 Thinker 的”想法”转成语音编码,一次预测多层音频码流,由 Mimi 解码器还原成 24kHz 的流式语音[3]

翻译成人话就是:一个负责想,一个负责说,配合默契。所以它生成的每一句回答,都自带语音输出。

至于语音的实际听感如何,我只能说每个人有每个人的判断,在这里我放一下默认音色生成的音频,供大家试听。

它甚至还支持音色克隆:内置 5 个音色(dylan、eric、serena 等)+ 7 个 unseen 音色,上传一段参考音频就能让模型模仿那个声音说话。官方给了音色相似度评测数据,最好的能达到 0.72 左右的余弦相似度(CAM++ embedding)[3],同时也直言”目前效果还谈不上高保真克隆,长句里容易被发音和节奏问题带偏”[3]。

所以,能用吗?

最后回到标题的问题:0.1B 的全模态模型,能用吗?

我的结论是:当玩具用,它是神;当工具用,它是鬼。 神鬼一念间了属于是

  • 它证明了”小模型 + 全模态”这条路走得通:0.1B 就能听、能说、能看,还是端到端
  • 它提供了完整的代码、权重、数据和训练流程,单卡 3090 约 2 小时就能从零跑通训练链路[1]——这对想学 Omni 模型原理的人来说,是教科书级的开源项目。
  • 但它的知识水平、长文本能力、语音自然度,都根本撑不起任何正经使用场景

如果你也想折腾,步骤很简单:克隆仓库 → 装依赖 → 从 ModelScope 下权重 → python eval_omni.py 就能开聊;想体验实时语音对话还有 WebUI,甚至支持电话模式(barge-in 打断、近似双工)[1]。全程不需要独显,CPU 就能跑——我实测加载约 1-2 分钟,回答一句的速度在可接受范围。

哦对了,至于开头那个”四人份早餐”的翻车现场——我后来专门把同一个问题又喂给了它,结果这次它反而列出了一整套像样的食谱(燕麦粥+牛奶、煎蛋+全麦吐司、烤鸡胸肉配米饭……)。同一个问题,两次答案天差地别:一次答非所问,一次像模像样。这大概就是 0.1B 的”随机数生成器”本色了:它不是在思考,而是在“蒙”答案

因为大模型的本质就是个基于海量数据训练出来的概率模型。它通过分析文本中词语和句子出现的规律,学习到语言的内在模式和知识,而不是真正“理解”或“思考”。它只会在给定前文的情况下,猜下一个词最可能是哪个。所以,在参数量极小的情况下,它实际上有很大概率“猜不准”,更容易受到一些不合适数据的影响,从而一本正经的胡说八道。

总之,我的评价是,还是把他当玩具/学习参考用吧0.1b诶!还要啥自行车啊 (bushi


参考链接:

[1] jingyaogong. MiniMind-O: 从0训练0.1B能听能说能看的全模态Omni模型[EB/OL]. GitHub, 2026-05-05. https://github.com/jingyaogong/minimind-o

[2] jingyaogong. minimind-o 仓库页面[EB/OL]. GitHub. https://github.com/jingyaogong/minimind-o

[3] Jingyao Gong. MiniMind-O Technical Report: An Open Small-Scale Speech-Native Omni Model[EB/OL]. arXiv:2605.03937. https://arxiv.org/abs/2605.03937

[4] gongjy. minimind-3o-pytorch 模型权重[EB/OL]. ModelScope. https://www.modelscope.cn/models/gongjy/minimind-3o-pytorch

About this Post

This post is written by xjhjtzac, licensed under CC BY-NC-SA 4.0.

#AI #Omni