给AI团队找一家靠得住的数据标注外包,有时比选模型框架更磨人:语音要方言和口音,视觉要点云和语义分割,大模型还要SFT语料与偏好排序,每一类的验收口径都不一样。这份AI数据标注服务公司名单面向算法负责人、数据工程师和刚拿到预算的创业团队,把国内真正能接项目、能签合同、能按里程碑结算的服务商摆在一起对比,省掉一轮又一轮的试标和比价。名单里既有科创板和新三板的挂牌公司,也有起步几年、在细分场景里做得很扎实的团队,还有大厂旗下对外开放的标注平台,规模、脾气和接单门槛都不一样,小到几千条语料的试点,大到PB级的自动驾驶数据闭环,都能在里面找到对应的对手。
入选的前提很简单:公司现在仍在承接商业项目,官网有在更新的动态,有人接询价。比较的维度写得很细:数据类型覆盖到哪里,语音、图像、视频、3D点云、文本还是多模态;质量怎么控,是标审分离、交叉验证还是全量复核,宣称的验收准确率有没有真实项目背书;产能和交付周期能不能扛住十万帧级别的排期;用自有标注基地还是纯众包人力,两者在稳定性和单价上差别不小;平台是否支持私有化部署与API对接,涉密项目往往只认本地化;有没有ISO27001、ISO9001这类信息安全与质量认证,以及数据授权链条是否清晰,采集类项目还要看肖像与声音授权协议怎么签。上市或挂牌公司的年报数据也拿来对照,营收、客户数量、专利与软著数量比宣传语可信得多。单价一律不写死,这行按帧、按条、按小时计价,场景难度和赶工程度一变,报价立刻跟着变,写死了反而误导人。
名次由社区投票决定,编辑部只负责把可比的候选人请到同一张桌子上。看卡片时优点和缺点两栏都别跳过:有的公司强在语种数量,一口气能覆盖上百种语言和方言;有的强在点云与自动驾驶,2D与3D融合标注是老本行;还有的只适合已经写好标注规范的甲方,规范模糊就容易反复返工。合作过的团队欢迎留下评价,尤其是返工率、结算周期、项目经理的响应速度和数据交付格式这些合同里写不清的细节,它们恰恰是新客户最难提前打听到的东西。先看清楚自己的需求属于哪一类数据,再对着榜单挑人,比照着一家家宣传页盲发询价单要省心得多;先做一批小样试标再签大单,也是老甲方通用的做法。
澳鹏1996年成立于悉尼,澳交所上市,代码APX,2019年在无锡投资建成中国首个交付中心,中国总部设在上海,另有大连、重庆交付基地。全球众包池超过一百万人,覆盖一百七十多个国家、支持两百三十多种语言和方言,这套资源在多语种大模型评测和小语种转写上很难被替代。中国区自研了MatrixGo标注平台,专门面向企业本地部署,另有面向具身智能的数据开发平台。中国区业务增长快,2023年营收接近2.5亿元人民币,2024年上半年为1.83亿元。无锡交付中心2019年10月开业,投资约200万美元;小语种转写场景的日活跃交付人力曾超过五千人,自动驾驶2D与3D融合标注产能达到过两个月一千万帧。
安全管控是它被大厂选中的重要原因:项目室人脸识别门禁、进场交手机、高保密项目还要过安检,物理与网络双向隔离。适合有跨境语种需求、对合规审计要求高的甲方。不适合预算紧张的小团队:没有公开报价,走的是全球统一的流程审批,立项慢,众包人力的水平也有波动,甲方最好保留自己的抽检环节。中文站主要走留言板和联系表单,没有公开的售前邮箱与热线,第一次接触需要等商务回访。众包端有独立的任务App,个人接单和企业采购是两条完全不同的入口,别走错。
2010年成立于北京,新三板挂牌公司,代码831428,是国内做AI基础数据时间最长的一批企业。服务结构是全栈式:版权数据集、数据定制、行业解决方案三条线并行,语音识别与合成、计算机视觉、自然语言处理都有成品库存,客户上千家,海外市场占比不低。近两年把重心往具身智能挪,动作采集、遥操作数据这类新场景已经有落地案例,并入选行业智库的优秀案例名单。公司注册资本约1.52亿元,办公地在海淀区宝盛南路奥北科技园,头衔里有国家级专精特新小巨人和高新技术企业,也参与过国家标准制定。
需要现成数据集救急、或者要一次性拿到多模态混合语料的团队可以先问它,库存品类是明显优势,签授权比从零采集省钱省时。挂牌公司的定期报告能查到营收和股东信息,做供应商审计时资料好凑。要注意的是公开报价同样没有,版权数据集的使用范围、可否商用、能否二次分发都要逐条谈清楚;定制采集项目周期长,赶时间的模型迭代不要压在这条路上。语音是它最厚的一块,视觉与点云的产能存在,但在自动驾驶这类重工程场景里,专做点云的厂商工具链更顺手。想省钱的团队可以先翻它的成品库,能买到现成的就别再重新采集一遍,授权价通常远低于定制采集,交付也快得多。
北京云测信息技术有限公司2011年创立,主业是云测试,2017年12月单独立起AI数据标注品牌云测数据。差异点在自建:既有数据场景实验室,可以按客户要求搭出会议室、车舱、便利店这类真实场景做采集,也有自有标注基地,团队坐班而不是纯靠众包接单,交付精准度对外宣称达到99.99%。文本、语音、图像、视频都覆盖,标注平台支持私有化部署与AI数据集管理。公司持有ISO9001、ISO27001、ISO20000等认证,专利与软著超过三百项,员工规模五六百人,北京、杭州、上海、深圳、成都、广州都设有分支机构,从创建任务到最终验收有固定的流程节点,2020年服贸会上还公开展示过标注交付成果,是国家高新技术企业。
场景化采集是它最值得花钱的地方,尤其是智能座舱、智慧零售、智能家居这类需要还原环境的项目,外面很难找到同等条件。400热线和商务邮箱都公开,出了问题能找到人,这在数据外包里很实用。反过来说,公司资源同时压在测试、安全与数据三条业务上,数据线并非唯一重心;场景实验室采集单价不便宜,长尾语种和方言语音能力也弱于专做语音的厂商。此外品牌被云测试的名气盖着,很多甲方到现在还以为它只做App测试,采购时容易漏掉。
2012年成立于杭州萧山,AI基础数据服务商,做数据采集、数据标注、成品数据集销售,也接标注平台定制开发。技术底子来自指纹方向:假指纹检测与指纹防伪算法在2017年和2019年两届国际活体指纹检测大赛LivDet中拿到第一名,公司持有十余项专利、三十余项软著,通过ISO9001与ISO27001认证。标注平台走标审分离,支持数据隔离与私有化部署,图像、语音、文本、3D点云都能标。2025年完成数千万元Pre-A轮融资,重点投向自建标注基地。注册资本1052.64万元,服务过的企业与高校科研机构数以千计,标注平台引入SAM一类算法做预分割,也在试人机结合的自动标注流程。
适合预算中等、需要有人陪着一起把标注规范磨出来的团队,公司规模不算大,项目经理沟通直接,教育题库、智慧医疗、智能驾驶方向都有过成规模的交付。缺点是体量比头部厂商小,超大批量的并行排期要提前谈;对外资料偏营销口吻,具体产能数字得在沟通中一项项问清楚。它更像陪跑型供应商,甲方标注规范越清晰,双方越省事;规范含糊,返工次数就会明显上升。公开的邮箱和手机号都能直接打通,这一点在同行里其实并不普遍,中小团队问价不必层层绕商务代表。
2018年11月成立于杭州滨江,从自动驾驶数据服务切进来,核心产品是SEED数据标注平台,目前已迭代到第三代,集数据标注、项目管理与数据生命周期治理于一体,图像、语音、文本、视频、3D点云全覆盖,也提供AI数据中台和模型训练平台。平台内置十八种AI预标注辅助工具,官方说法是整体效率比行业平均水平高出两成以上,部分场景能提到两三倍。已在华为云、阿里云的云市场上架,走产品驱动路线,客户里主机厂和造车新势力占比高。2021年1月完成千万级人民币天使轮融资,投资方为立元创投与伽利略资本,此后又完成A+轮,另有AutoLabeling自动标注平台和AI数据中台在售。
2D与3D融合标注、高精地图、导航相关的标注需求找它比较对路,工具链是围绕这些场景磨出来的。语音与自然语言方向明显弱一些,需要方言语料或者对话式AI数据的团队不必绕道。另外公开联系渠道少,官网基本只有介绍页,商务对接多通过云市场或者销售个人跟进,采购流程规范的大企业可能觉得不够顺手。适合已经有明确点云标注规范、希望把工具和流程一起打包买下来的车企与算法团队。只需要少量图片标注的小项目,走云市场自助采购反而更快,也省去一轮商务谈判。
起源于浙江大学计算机创新技术研究院,公司注册在杭州萧山,主打智能数据工程平台MolarData加数据集构建服务ACE Service。卖点是把前沿大模型接进标注流程:一键全图分割、点选交互式标注、批量预标注,图像目标检测、语义分割、点云目标检测等场景的智能标注准确率官方称可达95%,平均缩短约七成的数据标注工程周期。公司是中国人工智能产业发展联盟与ASAM协会成员,参与过多项行业标准与白皮书撰写,已完成数千万元A轮融资。平台能处理图像、视频、文本、音频、点云等多模态数据,内置MLOps模型训练系统,把标注工程与训练工程接成闭环,合作过的国内外科技公司与科研机构有数百家,持有知识产权数十项。
有意思的是全球化布局:新加坡设有Global Office,东南亚和非洲建了AI数据训练师基地,跨境项目的数据合规和成本控制多了一条路。适合智能驾驶、AIGC、智慧医疗方向愿意用工具提效的团队,尤其是甲方自己有算法团队、能配合调预标注模型的情况。成立时间短、团队规模小是客观事实,语音数据不是它的主场,超大规模纯人力项目还是要看头部厂商。预标注准确率的实际表现和数据本身的难度强相关,签约前建议拿最难的一批样本先试。
2016年2月成立于北京,总部在中关村东升科技园,深圳、杭州、长春设有分公司,知识产权超过一百二十项。公司同时做智能语音交互和AI数据服务,语音合成是招牌:开创了TOBI国际标注体系在中国商业领域的应用,自研TTS工具能把音频自动转成文字、拼音、韵律、词性,辅助标注人员提速。数据服务覆盖多语种与方言的音频转写、语音识别采集标注,也自研了3D标注工具处理激光采集的点云。声音超市平台汇集千余种音色,供企业挑选定制发音人。核心团队成员来自微软、腾讯、百度以及中科院声学所、清华大学,多人有十五年以上语音与数据行业资历,异地项目可以就近对接,现场沟通的来回成本降了不少。
对做TTS、语音评测、对话机器人的团队,它的韵律与情感标注体系比通用厂商细致得多。官网开放了非商用的中文语音合成数据库,学术和科研项目可以先下载验证质量,这一点在国内不多见。局限也清楚:视觉与点云属于配套能力,通用图像标注排期不一定优先;开源数据严禁商用,商业授权仍需单独谈;定制项目报价不透明,需要走售前评估。另一点值得留意:语音合成技术与数据服务共用一套团队,赶上TTS项目高峰期,数据侧的排期会被挤。好在售前电话是真人接的,能问到排期,这点比只留表单的同行省事。
2017年5月成立于北京,团队算法出身,创始人此前在世界银行与硅谷做了十来年算法工作。公司走的是系统加服务的路子:Rosetta标注系统负责生产,MorningStar平台负责数据闭环,支持模型真值对比、难例发现与数据追溯,把标注结果送回训练环节形成迭代。官方口径是平台自动化水平超过60%,数据质量达到99.9%,年处理数据量过亿。2022年完成5000万元A轮融资,交付形式包括私有化部署、SaaS在线服务和开源版本,对高校与科研机构也有支持政策。A轮由华映资本领投,厚天资本与瑞夏资本跟投,办公地在朝阳区东三环建外SOHO,平台已支撑数百个AI应用落地。
适合算法团队自己想掌控数据流程的甲方,尤其是需要难例挖掘、模型迭代闭环的项目,工具设计明显是从算法工程师视角出发的。无人驾驶、智慧城市、机器对话、电商零售、金融保险都有落地案例。规模在行业里属于中小,纯人力密集的超大批量项目未必划算,私有化部署的费用也不算低,采购前值得把授权模式和后续维护条款问明白。它更适合把标注当成算法工作流一部分来管理的团队,只想找便宜人力堆量的需求,性价比不占优。开源版本可以先装起来试工具顺不顺手,再决定要不要买私有化授权。
前身是2016年11月成立的北京爱数智慧科技有限公司,品牌升级后中文名改为晴数智慧,英文名沿用Magic Data,总部在北京,香港和深圳设有全资子公司,全国多地布点数据处理中心。主攻方向是对话式AI与语音:为语音识别、语音合成、自然语言理解提供数据采集与标注,成品数据集覆盖朗读、对话、自发式等多种风格,说话人地域与年龄分布广。自研Annotator标注平台已迭代到5.0与6.0版本,可按私有化方式交付,另有MagicHub开源社区可申请下载开源数据集。创始人张晴晴是语音技术方向出身的博士,公司在多语种与方言数据的开放建设上也出过力。
服务过的合作伙伴包括微软、高通、阿里巴巴、百度、腾讯等,行业上集中在智慧金融、智慧出行、智能社交、智能家居和智能终端。如果项目卡在真人自然对话语料上,它的场景设计和说话人筛选经验值得付费。图像与点云不是重点,做纯视觉的团队没必要在这里排队。官网只留联系表单,没有公开邮箱和热线,第一次接触要等商务回访,急单不太友好。真人对话语料的成本天然高于朗读语料,预算有限的团队最好先明确到底需要多少小时的自发式对话,按小时报价的项目里,这个数字直接决定总价,也决定谈判空间。