<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>大模型 on 大卷学长的博客</title><link>https://blog.liurb.org/tags/%E5%A4%A7%E6%A8%A1%E5%9E%8B/</link><description>Recent content in 大模型 on 大卷学长的博客</description><generator>Hugo -- gohugo.io</generator><language>zh-cn</language><lastBuildDate>Fri, 09 Oct 2026 17:35:00 +0000</lastBuildDate><atom:link href="https://blog.liurb.org/tags/%E5%A4%A7%E6%A8%A1%E5%9E%8B/index.xml" rel="self" type="application/rss+xml"/><item><title>新词「豆包喂养」到底是何方神圣？</title><link>https://blog.liurb.org/posts/2026/10/09/doubao-weiyang-modou/</link><pubDate>Fri, 09 Oct 2026 17:35:00 +0000</pubDate><guid>https://blog.liurb.org/posts/2026/10/09/doubao-weiyang-modou/</guid><description>&lt;img src="https://blog.liurb.org/images/posts/2026/doubao_weiyang_modou_cover.png" alt="Featured image of post 新词「豆包喂养」到底是何方神圣？" />&lt;p>最近一段时间，刷到了&amp;quot;豆包喂养&amp;quot;这样的一个新词。&lt;/p>
&lt;p>我一开始也以为它是那种&amp;quot;把豆包养成另一个自己&amp;quot;的玩法。真去查了一圈才发现，说的是字节这些大厂招真人去录语音、做标注，给大模型&amp;quot;造数据&amp;quot;这类活。而这些活，基本都挂在字节自己搭的一个平台下面：&lt;strong>「模兜」&lt;/strong>。&lt;/p>
&lt;h2 id="模兜这些活儿的大本营">「模兜」：这些活儿的大本营
&lt;/h2>&lt;p>&lt;img src="https://blog-worker.liurb.org/api/2026/10/modoudance_06_a.png"
loading="lazy"
>&lt;/p>
&lt;h3 id="模兜到底是个什么平台">模兜到底是个什么平台
&lt;/h3>&lt;p>&lt;strong>模兜是字节跳动旗下的 AI 数据众包与专家服务平台&lt;/strong>，官网 &lt;code>modoudance.com&lt;/code>（这套业务以前还用过 &lt;strong>竹节、闲包包&lt;/strong> 两个名字）。它一头连着要高质量语料的豆包等大模型，一头连着有专业背景、想接单变现的人。&lt;/p>
&lt;h3 id="上面都在招些什么活">上面都在招些什么活
&lt;/h3>&lt;p>模兜上的活，早就不是传统那种拉框打标了，更像在&amp;quot;教 AI 说话、做判断&amp;quot;。我扒了下平台在招的任务，大致落在四类：&lt;/p>
&lt;ul>
&lt;li>&lt;strong>语音 / 对话录制&lt;/strong>：数量最多、单价也最高。招&lt;strong>双人搭档&lt;/strong>进线下录音棚，围绕一个专业场景自然对话：教师教学、少儿教学/科普、升学规划、模拟辩论、法律咨询、角色扮演情境模拟都有，单价 &lt;strong>1500–5000 元&lt;/strong>；方言双人 FreeTalk、方言录音棚也算这一类。&lt;/li>
&lt;li>&lt;strong>方言与语音数据&lt;/strong>：方言数据整理（三亚、怀化、玉林、江门等片区）、方言众测、豆包方言体验调研、豆包通话打卡，单价几十到几百。&lt;/li>
&lt;li>&lt;strong>专业评测&lt;/strong>：给 AI 生成的音乐打分（旋律、和声、编曲、原创性等维度），还有医疗领域的医生评估校验。&lt;/li>
&lt;li>&lt;strong>数据采购&lt;/strong>：像 3D 动捕数据采购，给 &lt;code>T2M&lt;/code>（text-to-motion）模型备料。&lt;/li>
&lt;/ul>
&lt;h3 id="一个真实的任务长什么样">一个真实的任务长什么样
&lt;/h3>&lt;p>光说类型有点干，直接看个真挂出来的单子更清楚。我在模兜上翻到一个还在招募的《少儿教学/科普-自然对话录制》：&lt;/p>
&lt;ul>
&lt;li>招&lt;strong>双人搭档&lt;/strong>去录，一个演&amp;quot;老师/引导者&amp;quot;，一个演&amp;quot;学生/陪聊&amp;quot;，内容是少儿教学、科普场景下的自然对话；要求真实自然，别照稿念、别尬演；&lt;/li>
&lt;li>线下实体录音棚录制，全国主要城市都有棚，总时长 4 小时，每人最多录一场；&lt;/li>
&lt;li>单价 &lt;strong>1500–2500 元&lt;/strong>；有&lt;strong>试音环节&lt;/strong>，录用周期大约 1 天；&lt;/li>
&lt;li>人员画像上，&amp;ldquo;老师&amp;quot;那位最好有少儿教育、科普、亲子、教培或兴趣教学的底子；&amp;ldquo;陪聊&amp;quot;那位则要真学生、真小孩，或者声音特别像孩子。&lt;/li>
&lt;/ul>
&lt;p>&lt;img src="https://blog-worker.liurb.org/api/2026/10/modoudance_12.png"
loading="lazy"
>&lt;/p>
&lt;p>它的参与流程比一般任务细：先看需求文档、做完初试题，然后自己找搭档（没搭子的话平台也能帮忙配对），录一段 5 到 10 分钟的试音，场景选&amp;quot;教学&amp;quot;提交，等结果；&lt;strong>试音过了&lt;/strong>，再交正式大纲，最后有专人约档期，去线下录音棚录。&lt;/p>
&lt;p>而试音能不能过，标准就一条：&lt;strong>真实自然、聊得起劲&lt;/strong>。对话得像是真朋友在聊天，不做作、不念稿，双方都能接住彼此的话，越聊越有劲。&lt;/p>
&lt;p>这张单子其实把门槛说明白了：它要的不是&amp;quot;能说话的人&amp;rdquo;，是特定角色加特定经验，还得真能把天聊起来。&lt;/p>
&lt;h3 id="但先说清楚这活儿没那么好赚">但先说清楚：这活儿没那么好赚
&lt;/h3>&lt;p>看到 1500 到 2500 元、甚至几百块一小时这样的数字，很容易心动。社交平台上还流传着一批招募卡片，标题写着&amp;quot;双人对话题制&amp;quot;&amp;ldquo;自然对话录音招募&amp;quot;&amp;ldquo;模拟辩论&amp;quot;之类，单价从几十到几千不等。&lt;/p>
&lt;p>&lt;img src="https://blog-worker.liurb.org/api/2026/10/modoudance_03.png"
loading="lazy"
>&lt;/p>
&lt;p>但这些数字背后，有两个特别容易被晃过去的坑。&lt;/p>
&lt;p>一个是&lt;strong>工时放大效应&lt;/strong>。在专业录音这行，想产出 1 小时合格的高质量有效对话，从前期对戏、反复重录，到后期剔废话、剪辑，实际往往得砸进去 &lt;strong>8 到 20 个小时甚至更久&lt;/strong>。所以真正该看的&amp;quot;时薪&amp;rdquo;，是拿合格音频时长去除，而不是拿你在麦克风前坐着的时长。&lt;/p>
&lt;p>另一个是&lt;strong>高价任务的隐形门槛&lt;/strong>。标价 &lt;code>3000–5000 元/小时&lt;/code> 的那批，一般要求播音主持的底子、配音演员的演技，或者能用特别自然的口吻把复杂情绪演活；普通小白够得着的，是闲聊类和基础 &lt;code>Agent&lt;/code> 调优这类活，单价通常就几百甚至几十块（招募卡片里 &lt;code>50–100 元/小时&lt;/code> 的一大把）。&lt;/p>
&lt;p>举几个公开报道里的例子。字节从年初起就在北京大钟寺办公楼招素人为豆包大模型录音，两人一组、单次 3 小时（含 80 分钟自由聊天加 60 组带提示词对话），&lt;strong>单次结 300 元&lt;/strong>，全程至少两名字节员工陪着；录音不清晰、吞字、情绪不够，都要重录，质量太差还会酌情扣钱。招聘平台上更常见的，是 &lt;code>BOSS 直聘&lt;/code> 上 &lt;code>30–55 元/时&lt;/code> 的 AI 录音兼职，内容就是&amp;quot;用普通话线上聊 2 小时、分 12 段录&amp;rdquo;。方言采集更轻，用本地方言跟豆包聊 20 轮、录屏，再给识别结果打分，&lt;code>40 元/人/任务&lt;/code>。&lt;/p>
&lt;p>不过，就算看到这儿还想试试，也得先知道：模兜不是注册了就能接单。流程大致是先注册、完善专业档案，再报名任务、签协议、参加线上培训，最后还要过一道 &lt;strong>&amp;ldquo;试写考核&amp;rdquo;&lt;/strong>，不达标进不了正式作业；过了才能正式干活、交付，按小时或按天结算，打款到钱包提现。&lt;/p>
&lt;p>平台不卡证书，但很看专业匹配度：医疗、法律这类任务会优先要有对应从业经历的人，所以&lt;strong>报名不等于录取&lt;/strong>，光&amp;quot;试写&amp;quot;这一关就能刷掉一批。计费公开区间大约 &lt;strong>56–1000 元/小时&lt;/strong>，整体比传统标注高一个量级，但门槛也确实高得多。&lt;/p>
&lt;h2 id="字节手里有抖音为什么还要花钱喂数据">字节手里有抖音，为什么还要花钱&amp;quot;喂&amp;quot;数据？
&lt;/h2>&lt;p>抖音是国内最大的短视频平台，月活 10 亿上下，光每月新增的视频就 2.2 亿条，直播一场接一场，按这个体量，豆包要的&amp;quot;语料&amp;rdquo;，好像是现成的。&lt;/p>
&lt;p>可真要细说，&amp;ldquo;平台手里有数据&amp;quot;和&amp;quot;这些数据能拿去训模型&amp;rdquo;，完全是两回事。&lt;/p>
&lt;p>首先，&lt;strong>短视频不是&amp;quot;对话&amp;quot;&lt;/strong>。抖音上的内容大多是单向的：口播、独白、带货、表演，一个人对着镜头说。而语音助手、Agent 这类产品最缺的，恰恰是&lt;strong>多轮、真实、自然的双人对话&lt;/strong>：你一句我一句、有来有回。这种数据短视频里几乎淘不到，只能找人专门录，这也是为什么模兜的高价单，清一色是&amp;quot;双人搭档进录音棚&amp;quot;。&lt;/p>
&lt;p>第二个，&lt;strong>用户上传的内容，不是想用就能用&lt;/strong>。视频里的画面、声音、肖像，版权和人格权都攥在用户手里。按《个人信息保护法》和生成式 AI 的管理办法，拿用户内容训模型，得单独把&amp;quot;训练&amp;quot;这个用途讲清楚、再取得同意；最高法的相关意见更直接：&lt;strong>没经同意拿别人的声音去训练，算侵害声音权益&lt;/strong>。所以平台真正要的，是&amp;quot;来源干净、可商用&amp;quot;的数据，这也是模兜任务里反复出现&amp;quot;保密协议&amp;quot;&amp;ldquo;可商用&amp;quot;的原因。&lt;/p>
&lt;p>还有一点，&lt;strong>抖音覆盖的是大众娱乐，缺专业人员&lt;/strong>。法律咨询、升学规划、模拟辩论、教学、方言，这些垂直、长尾的场景，短视频里又浅又散。模型想&amp;quot;会聊专业&amp;rdquo;，只能请真懂行的人来录。&lt;/p>
&lt;p>所以大厂的处境其实是：&lt;strong>存量的&amp;quot;野生&amp;quot;语料不缺，缺的是&amp;quot;可商用 + 专业场景 + 多轮对话&amp;quot;的增量数据&lt;/strong>。数据荒说的从来不是&amp;quot;没数据&amp;quot;，是&amp;quot;能用的高质量数据&amp;quot;不够。有研究干脆预测，照现在的消耗速度，人类高质量的公开训练数据，可能撑不到 2030 年前后。&lt;/p>
&lt;p>想通这一层，模兜为什么存在、那些单价为什么开得那么高，就大概知道原因了。&lt;/p>
&lt;p>&lt;img src="https://blog-worker.liurb.org/api/2026/10/douyin-corpus-vs-collected-20261009-223019.png"
loading="lazy"
alt="平台上的存量&amp;#34;野生&amp;#34;语料，经筛选转化为可商用的精标增量数据"
>&lt;/p>
&lt;h2 id="传统标注-vs-这波新玩法新在哪">传统标注 vs 这波新玩法：新在哪
&lt;/h2>&lt;p>要弄明白&amp;quot;豆包喂养&amp;quot;到底新在哪，得先知道以前的传统玩法是怎么样的。&lt;/p>
&lt;h3 id="老一套传统数据标注长什么样">老一套：传统数据标注长什么样
&lt;/h3>&lt;p>数据标注这行其实一点都不新，说白了就是&amp;quot;教机器认世界&amp;quot;：给图片拉框、把语音转成文字、给文本分类打标。这活儿上手是真快，但也真枯燥，早些年高中、中专学历就能干，一度被当成&amp;quot;数据车间&amp;quot;里的流水线工种。&lt;/p>
&lt;p>代价就是单价被压得极低。有媒体梳理过一条曲线：2017 年的黄金期，一张简单的 2D 框还能有一毛多，甚至有人开到 5 毛；到了 2023 年，同样的活跌到 &lt;strong>3–4 分钱&lt;/strong>，跌幅超过 90%。更难一点的 3D 点云框，也就 5 分一个。&lt;/p>
&lt;p>落到人头上是什么概念？有湖南的标注员晒过结算单：一天拉 700 多个框、单价 4 分，到手 &lt;strong>30.2 元&lt;/strong>。广东清远那边，计件每天 2000 个拉框大概 120 元，计时的话一天 100 元上下。整个行业看下来，传统标注公司月薪多在 &lt;strong>3000–5000 元&lt;/strong>，兼职时薪 &lt;strong>20–30 元&lt;/strong>，低的只有十几块。&lt;/p>
&lt;p>管得也严。质检合格率普遍要 95% 以上，狠一点的公司卡到 98–99%，&lt;strong>拉 100 个框，错 2 个，整张图就被打回返修&lt;/strong>。不少基地要求上班把手机锁进储物柜，鼠标轨迹、停留时间都被系统盯着，停超过三分钟就弹警告。&lt;/p>
&lt;p>这几年它还被&amp;quot;基地化&amp;quot;了。国家数据局在全国布了 7 个数据标注基地：成都、沈阳、合肥、长沙、海口、保定、大同。拿大同来说，从业者里 94% 是本地户籍，带动了 3 万多人次就近就业。对不少县城青年和宝妈来说，这是家门口一份&amp;quot;坐办公室&amp;quot;的活；但说到底，还是实打实按件计酬的体力活。&lt;/p>
&lt;p>行业里有句自嘲挺到位：&lt;strong>&amp;ldquo;有多少人工，就有多少智能。&amp;rdquo;&lt;/strong>&lt;/p>
&lt;h3 id="这波新在哪">这波新在哪
&lt;/h3>&lt;p>把传统和这波放一起对比，差别就清楚了：&lt;/p>
&lt;table>
&lt;thead>
&lt;tr>
&lt;th>维度&lt;/th>
&lt;th>传统数据标注&lt;/th>
&lt;th>这波新玩法（专家众包）&lt;/th>
&lt;/tr>
&lt;/thead>
&lt;tbody>
&lt;tr>
&lt;td>典型任务&lt;/td>
&lt;td>拉框、打标、语音转写、文本分类&lt;/td>
&lt;td>专业场景双人对话录制（教学/法律/辩论/升学/角色扮演…）、方言语音数据、专业评测、数据采购&lt;/td>
&lt;/tr>
&lt;tr>
&lt;td>劳动性质&lt;/td>
&lt;td>重复性体力活&lt;/td>
&lt;td>认知劳动，要专业判断&lt;/td>
&lt;/tr>
&lt;tr>
&lt;td>门槛&lt;/td>
&lt;td>早期高中/中专即可，现多要大专&lt;/td>
&lt;td>主发音人要有真实专业经历（教师/律师/辩手等），陪聊不设限&lt;/td>
&lt;/tr>
&lt;tr>
&lt;td>计价&lt;/td>
&lt;td>按件，几分到几毛/框&lt;/td>
&lt;td>按小时或按场，专业对话录制单场 1500–5000 元&lt;/td>
&lt;/tr>
&lt;tr>
&lt;td>谁在发单&lt;/td>
&lt;td>第三方标注公司、各地标注基地&lt;/td>
&lt;td>大厂自建众包平台（模兜等）&lt;/td>
&lt;/tr>
&lt;tr>
&lt;td>自动化风险&lt;/td>
&lt;td>底层拉框正被 AI 替代&lt;/td>
&lt;td>专家认知劳动暂难替代&lt;/td>
&lt;/tr>
&lt;/tbody>
&lt;/table>
&lt;p>&lt;img src="https://blog-worker.liurb.org/api/2026/10/labeling-vs-doubao-feeding-20261009-211813.png"
loading="lazy"
alt="传统数据标注 vs 这波新玩法（专家众包）对比"
>&lt;/p>
&lt;p>我自己的感受是，这里面真正变的不止一处。&lt;/p>
&lt;p>最直观的是&lt;strong>劳动性质&lt;/strong>：从&amp;quot;体力活&amp;quot;变成了&amp;quot;认知活&amp;quot;，还带点表演成分。传统标注拼手速、拼耐心；这波拼的是专业判断和临场表达：教师得把知识讲明白、律师得懂实务、辩手真能辩，而且都得自然到不像在念稿。&lt;/p>
&lt;p>然后是&lt;strong>计价和门槛&lt;/strong>。按件变成了按小时或按场，拉框几分钱一个，专业对话录制单场能到 &lt;code>1500–5000 元&lt;/code>。门槛也跟着变，但卡的不是&amp;quot;学校档次&amp;quot;，而是&amp;quot;角色和专业经历&amp;quot;，主发音人得有真实专业经历（教师、律师、辩手、升学顾问这类），陪聊那头反倒不设限。真要论学历线，这几年整体也在往上走：有从业者回忆，2016 到 2018 年中专学历就够，后来要大专，如今大模型标注普遍要本科、研究生。&lt;/p>
&lt;p>还有一个容易被忽略的：&lt;strong>底层正在被 AI 吃掉&lt;/strong>。简单的拉框打标，正被自动化标注工具快速替代；替代不了的，是&amp;quot;语义理解、价值判断&amp;quot;这类认知环节，也就是这波真正值钱的部分。&lt;/p>
&lt;h2 id="哪些领域哪些人适合去试">哪些领域、哪些人适合去试
&lt;/h2>&lt;p>有专业背景的，就走模兜这类专家平台，几个方向看着挺对口：教育（教师、讲师、幼教、教培从业者）对应教学、少儿科普这类双人对话录制；法律（执业律师、法务）对应法律咨询场景录制；升学规划（志愿填报、生涯规划顾问）和辩论（辩手、教练、评委）对应升学咨询、模拟辩论录制；语言（方言母语者、翻译、语言学爱好者）对应方言数据整理与语音采集；音乐（音乐相关专业）和表演（演员、配音）对应 AI 音乐评测、角色扮演情境模拟；医疗（医生）对应医生评估校验。&lt;/p>
&lt;p>没有专业背景的，基本只能走传统标注那条线：在校及应届生、县域青年、宝妈、想找个灵活班的人。但得清醒：单价低、枯燥、成长有限，底层拉框还在被自动化挤压。&lt;strong>当个过渡收入可以，别把它当天花板。&lt;/strong>&lt;/p>
&lt;h2 id="我的一点看法">我的一点看法
&lt;/h2>&lt;p>普通人能靠它搞钱吗？&lt;/p>
&lt;p>这波&amp;quot;豆包喂养&amp;quot;买的与其说是&amp;quot;劳动时长&amp;quot;，不如说是&lt;strong>你的真实专业经验&lt;/strong>。模兜上最贵的那批单子，要的不是&amp;quot;会说话的人&amp;quot;，是&amp;quot;能把一段专业对话演真的人&amp;quot;：教师得讲明白、律师得懂实务、辩手真能辩，还得自然到不像念稿，单场 1500 到 5000 元，买的就是这份经验。同一张单子里，主发音人卡专业经历、陪聊那头不设限，&lt;strong>价格是按经验值不值钱分的，不是按你坐了多久&lt;/strong>。&lt;/p>
&lt;p>坑也在这儿：&lt;strong>工时放大效应&lt;/strong>，1 小时合格音频背后往往是 8 到 20 个小时，算账得拿&amp;quot;合格产出&amp;quot;去除。所以我的建议就一条：&lt;strong>先掂量自己有没有一段能&amp;quot;演出来&amp;quot;的真经验&lt;/strong>。有硬专业（医疗、法律、教学、方言母语这些）的，去模兜跑几个周期短的任务试水，性价比是真不错；没有的话，边角活挣点零花可以，但别指望它撑起一份副业，那批高价单的门槛，比招募卡片看着的硬得多。&lt;/p>
&lt;p>最后，就算你压根不打算接单，模兜也值得瞄一眼：&lt;strong>它上面在招什么任务，大致就对应着大模型当下最缺哪类数据&lt;/strong>。抖音那样的存量语料堆成山，也补不上&amp;quot;多轮对话、专业场景、可商用&amp;quot;这几个窟窿。这是个不太需要内部消息、就能看到 AI 数据产业链怎么转的窗口。&lt;/p></description></item></channel></rss>