设置
  • 日夜间
    随系统
    浅色
    深色
  • 主题色

清程极智翟季冬:token也有“质量问题”

发布时间: 2026-06-12 09:42:30 来源: 新京报

在智能体活跃,token(词元)消耗量呈指数级增加的2026年,token经济以及算力的受重视程度与日俱增。以“龙虾”OpenClaw为代表的智能体需要消耗算力,用户必须从token供应商处获取API key(密钥),才能让这些智能体正常运行。rBs速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

不过,许多人不知道的是,即便是同一款模型,根据供应商的不同,其token的“质量”也会存在差异。近日,‌清华大学计算机系长聘教授‌、博士生导师,‌清程极智首席科学家翟季冬接受了新京报贝壳财经记者的采访,揭开了token经济中这一“隐秘的角落”。rBs速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

此外,作为曾带领清华团队十五次获得国际大学生超算竞赛冠军的指导老师,翟季冬和团队成员也对当前国产算力芯片如何与大模型进行适配,以及二者之间“推理引擎”层的作用,对新京报贝壳财经记者进行了科普。rBs速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

rBs速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

‌清华大学计算机系长聘教授‌、博士生导师,‌清程极智首席科学家翟季冬回答记者提问。罗亦丹/摄rBs速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

同一模型,便宜token有可能更“费钱”rBs速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

“token是今年最火的词,但token底层涉及很多技术。”翟季冬开门见山地说,在他看来,token产业可以分为三层:底层是在芯片上部署大模型,生产token的生产层;中间层是作为token供应商转运分发token的流通层;最上层则是个人和企业用户直接调用API消费token的使用层。rBs速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

这三层结构听上去跟电力系统有些相似,但翟季冬强调,两者的成熟度完全不在一个量级,“当我们用电时,不用担心发出来的电有‘差别’,但token不同,同样的模型、同样的价格,token质量却可能参差不齐。”rBs速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

他告诉记者,实际上,token供应商的指标有很多,除了通俗易懂的价格、上下文长度外,还有首字延迟、吞吐量,以及普通用户较难理解的精度、 KV Cache(键值缓存)命中等。rBs速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

而这些“隐秘的细节”可能决定模型的效果和token消耗的大小。rBs速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

在模型效果方面,翟季冬举例称,比如模型发布时可能采用了BF16精度,但有些供应商会把它量化成INT8甚至INT4来部署,好处是算力消耗减半,可以承载更多用户,代价是模型能力被“裁剪”了,不再是原汁原味的效果。rBs速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

据了解,FP16、INT8等专业术语指的是大模型推理的精度,数字(4/8/16/32/64)代表位数,一般来说,位数越高,计算精度越高、结果越准,但速度越慢、消耗算力越大;位数越低,速度越快、越省算力,但会轻微损失模型效果。rBs速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

而在token消耗量方面,翟季冬给记者算了一笔账:同样的模型,一家供应商报价每百万token3元,另一家报价1元,看似便宜的那家,实际总成本可能反而更高。“它有两行报价,一行是token命中,可能是一毛钱,token不命中是一块钱。但是它的token生产做得很差,你的这些请求都不命中,最后反而费钱。”rBs速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

清程极智联合创始人师天麾解释称,这里的核心技术是KV Cache(键值缓存)管理——在多轮对话场景中,缓存命中可以节省90%的成本,但不同供应商的缓存管理水平差距巨大,其中报价低的服务商也许缓存并不高,本该节省的那些缓存没能节省,导致总成本很高。但服务商在卖token时,一般不会直接说明缓存命中率是多少,甚至有些服务商直接不给缓存命中的优惠价格。rBs速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

针对这一乱象,清程极智推出了AI Ping一站式大模型服务评测与API智能路由平台,目前,平台已接入30余家主流服务商、600余个大模型服务,覆盖文本、图片、视频等全场景;通过7×24小时多地域分布式监测,实时输出延迟、吞吐、可靠性、价格等核心指标。rBs速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

rBs速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

不同供应商提供的DeepSeek-V4-Pro模型的token延迟情况对比图。数据来源:aiping.cnrBs速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

6月8日,新京报贝壳财经记者登录AI Ping平台,随机查看了DeepSeek-V4-Pro模型不同token供应商的延迟情况,发现其记录了价格、延迟、吞吐等指标。如对于延迟这一指标,一些服务商的曲线波动极大,而最为稳定的则是DeepSeek官方提供的token。rBs速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

“中国的电力系统在全世界是第一的,我们希望通过各种努力,能够把我国token服务的质量和性能也做到全世界第一。”翟季冬说。rBs速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

芯片发展趋势:支持的精度类型越来越多rBs速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

token质量的差异,追根溯源要落到芯片和推理引擎上。一个容易被忽略的事实是:在国产算力和国产模型之间,并不是直接对接的关系,中间还隔着一层至关重要的“推理引擎”。这层软件承上启下,决定了芯片的算力能不能被高效释放,也决定了最终生产出来的token质量够不够好。rBs速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

翟季冬用精度问题向贝壳财经记者解释了推理引擎的价值——“很多人认为芯片正在向精度越来越高发展,但事实上,芯片正在向支持的精度类型越来越多发展,例如,传统CPU可能只支持三、四种精度类型,而现在的AI芯片能支持十几种,从FP64、FP32、FP16到FP8、FP4,还有INT8、INT4等整数精度,每一种都有不同的性能和效果权衡。”rBs速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

“模型不是说一定要选最高的精度才好,因为精度更高的同时,也更慢,每个模型会选一个恰到好处的精度。”清程极智联合创始人唐适之补充道,“目前来讲,主流模型的选择往往跟随英伟达走——比如FP8就是英伟达推出Hopper系列显卡时新增的精度,DeepSeek觉得FP8最适合自己的模型,就选了这个标准。”rBs速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

但问题随之而来:国产芯片的精度支持并不完全跟英伟达对齐。“对DeepSeek来讲,国产卡有的精度过高有的精度过低,使用起来无论如何都是有损失的。”rBs速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

这正是推理引擎的用武之地。翟季冬告诉记者,海外主流推理引擎如vLLM、SGlang对英伟达、AMD的生态支持更好,但对国产芯片的优化投入有限。针对大模型部署成本高、国产算力适配不足的痛点,清程极智推出了自主研发的国产推理引擎赤兔,其对国产模型、国产芯片的支持在很多情况下比vLLM、SGlang要更好。rBs速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

这种优势不只是体现在精度适配层面。唐适之介绍,不同国产芯片的硬件特性差异很大,比如有些卡的张量计算能力和标量计算能力之间的权衡跟英伟达不一样,有些卡的卡间互联方式也不同,推理引擎需要针对这些特点做定制化设计。“我们要真正地根据国产卡上面的特点来选我们的实现方案,而不是说看英伟达上面有这个精度就选这个精度。”rBs速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

“我们将持续深耕AI基础设施领域,坚持核心技术自主可控,不断迭代赤兔推理引擎对国产芯片的适配能力,完善AI Ping评测与路由服务,联动国产算力、国产模型、行业应用等产业链伙伴,打造高效、普惠、安全的国产AI基础设施体系,响应国家‘人工智能+’行动,以技术创新推动中国AI产业高质量发展。”翟季冬说。rBs速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

在智能体活跃,token(词元)消耗量呈指数级增加的2026年,token经济以及算力的受重视程度与日俱增。以“龙虾”OpenClaw为代表的智能体需要消耗算力,用户必须从token供应商处获取API key(密钥),才能让这些智能体正常运行。rBs速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

不过,许多人不知道的是,即便是同一款模型,根据供应商的不同,其token的“质量”也会存在差异。近日,‌清华大学计算机系长聘教授‌、博士生导师,‌清程极智首席科学家翟季冬接受了新京报贝壳财经记者的采访,揭开了token经济中这一“隐秘的角落”。rBs速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

此外,作为曾带领清华团队十五次获得国际大学生超算竞赛冠军的指导老师,翟季冬和团队成员也对当前国产算力芯片如何与大模型进行适配,以及二者之间“推理引擎”层的作用,对新京报贝壳财经记者进行了科普。rBs速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

rBs速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

‌清华大学计算机系长聘教授‌、博士生导师,‌清程极智首席科学家翟季冬回答记者提问。罗亦丹/摄rBs速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

同一模型,便宜token有可能更“费钱”rBs速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

“token是今年最火的词,但token底层涉及很多技术。”翟季冬开门见山地说,在他看来,token产业可以分为三层:底层是在芯片上部署大模型,生产token的生产层;中间层是作为token供应商转运分发token的流通层;最上层则是个人和企业用户直接调用API消费token的使用层。rBs速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

这三层结构听上去跟电力系统有些相似,但翟季冬强调,两者的成熟度完全不在一个量级,“当我们用电时,不用担心发出来的电有‘差别’,但token不同,同样的模型、同样的价格,token质量却可能参差不齐。”rBs速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

他告诉记者,实际上,token供应商的指标有很多,除了通俗易懂的价格、上下文长度外,还有首字延迟、吞吐量,以及普通用户较难理解的精度、 KV Cache(键值缓存)命中等。rBs速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

而这些“隐秘的细节”可能决定模型的效果和token消耗的大小。rBs速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

在模型效果方面,翟季冬举例称,比如模型发布时可能采用了BF16精度,但有些供应商会把它量化成INT8甚至INT4来部署,好处是算力消耗减半,可以承载更多用户,代价是模型能力被“裁剪”了,不再是原汁原味的效果。rBs速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

据了解,FP16、INT8等专业术语指的是大模型推理的精度,数字(4/8/16/32/64)代表位数,一般来说,位数越高,计算精度越高、结果越准,但速度越慢、消耗算力越大;位数越低,速度越快、越省算力,但会轻微损失模型效果。rBs速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

而在token消耗量方面,翟季冬给记者算了一笔账:同样的模型,一家供应商报价每百万token3元,另一家报价1元,看似便宜的那家,实际总成本可能反而更高。“它有两行报价,一行是token命中,可能是一毛钱,token不命中是一块钱。但是它的token生产做得很差,你的这些请求都不命中,最后反而费钱。”rBs速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

清程极智联合创始人师天麾解释称,这里的核心技术是KV Cache(键值缓存)管理——在多轮对话场景中,缓存命中可以节省90%的成本,但不同供应商的缓存管理水平差距巨大,其中报价低的服务商也许缓存并不高,本该节省的那些缓存没能节省,导致总成本很高。但服务商在卖token时,一般不会直接说明缓存命中率是多少,甚至有些服务商直接不给缓存命中的优惠价格。rBs速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

针对这一乱象,清程极智推出了AI Ping一站式大模型服务评测与API智能路由平台,目前,平台已接入30余家主流服务商、600余个大模型服务,覆盖文本、图片、视频等全场景;通过7×24小时多地域分布式监测,实时输出延迟、吞吐、可靠性、价格等核心指标。rBs速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

rBs速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

不同供应商提供的DeepSeek-V4-Pro模型的token延迟情况对比图。数据来源:aiping.cnrBs速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

6月8日,新京报贝壳财经记者登录AI Ping平台,随机查看了DeepSeek-V4-Pro模型不同token供应商的延迟情况,发现其记录了价格、延迟、吞吐等指标。如对于延迟这一指标,一些服务商的曲线波动极大,而最为稳定的则是DeepSeek官方提供的token。rBs速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

“中国的电力系统在全世界是第一的,我们希望通过各种努力,能够把我国token服务的质量和性能也做到全世界第一。”翟季冬说。rBs速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

芯片发展趋势:支持的精度类型越来越多rBs速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

token质量的差异,追根溯源要落到芯片和推理引擎上。一个容易被忽略的事实是:在国产算力和国产模型之间,并不是直接对接的关系,中间还隔着一层至关重要的“推理引擎”。这层软件承上启下,决定了芯片的算力能不能被高效释放,也决定了最终生产出来的token质量够不够好。rBs速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

翟季冬用精度问题向贝壳财经记者解释了推理引擎的价值——“很多人认为芯片正在向精度越来越高发展,但事实上,芯片正在向支持的精度类型越来越多发展,例如,传统CPU可能只支持三、四种精度类型,而现在的AI芯片能支持十几种,从FP64、FP32、FP16到FP8、FP4,还有INT8、INT4等整数精度,每一种都有不同的性能和效果权衡。”rBs速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

“模型不是说一定要选最高的精度才好,因为精度更高的同时,也更慢,每个模型会选一个恰到好处的精度。”清程极智联合创始人唐适之补充道,“目前来讲,主流模型的选择往往跟随英伟达走——比如FP8就是英伟达推出Hopper系列显卡时新增的精度,DeepSeek觉得FP8最适合自己的模型,就选了这个标准。”rBs速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

但问题随之而来:国产芯片的精度支持并不完全跟英伟达对齐。“对DeepSeek来讲,国产卡有的精度过高有的精度过低,使用起来无论如何都是有损失的。”rBs速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

这正是推理引擎的用武之地。翟季冬告诉记者,海外主流推理引擎如vLLM、SGlang对英伟达、AMD的生态支持更好,但对国产芯片的优化投入有限。针对大模型部署成本高、国产算力适配不足的痛点,清程极智推出了自主研发的国产推理引擎赤兔,其对国产模型、国产芯片的支持在很多情况下比vLLM、SGlang要更好。rBs速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

这种优势不只是体现在精度适配层面。唐适之介绍,不同国产芯片的硬件特性差异很大,比如有些卡的张量计算能力和标量计算能力之间的权衡跟英伟达不一样,有些卡的卡间互联方式也不同,推理引擎需要针对这些特点做定制化设计。“我们要真正地根据国产卡上面的特点来选我们的实现方案,而不是说看英伟达上面有这个精度就选这个精度。”rBs速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

“我们将持续深耕AI基础设施领域,坚持核心技术自主可控,不断迭代赤兔推理引擎对国产芯片的适配能力,完善AI Ping评测与路由服务,联动国产算力、国产模型、行业应用等产业链伙伴,打造高效、普惠、安全的国产AI基础设施体系,响应国家‘人工智能+’行动,以技术创新推动中国AI产业高质量发展。”翟季冬说。rBs速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

在今天的故宫,工作人员使用的数字化办公平台名叫“内务辅”,这款应用的开发者,是与故宫博物院合作的钉钉(中国)信息技术有限公司(以下简称“钉钉”)。3月18日,故宫博物院与钉钉战略合作签约仪式在故 未来的足球场,人工智能(AI)当“大脑”?《自然·通讯》19日发表一项来自谷歌深度思维的最新成果,研究团队报告了一个名为“TacticAI”的系统,能在足球比赛中预测角球结果并提供实际且准确的战 眼眸深邃似海、璨如星河,中国医学科学院生物医学工程研究所眼科诊疗技术研发团队(以下简称“团队”)正是眼眸“侦探”。该团队不久前被授予“国家卓越工程师团队”称号。别看人眼只有8克左右,却 在近日举行的全球AI盛会GTC(GPU Technology Conference)2024上,联想集团与NVIDIA(英伟达)宣布合作推出全新混合人工智能解决方案,帮助企业和云提供商获得在人工智能时代成功所需的关键的加速计算能   盲视技术已在猴子身上见效!马斯克脑机接口公司新目标:让盲人重见光明  澎湃新闻记者 吴遇利  Neuralink新技术或将造福数千万名失明人士。  当地时间3月21日,特斯拉CEO埃隆・马斯克在社交平台X(原推特)发文称, 3月22日记者获悉,中国移动北京公司(北京移动)已于近日在北京亦庄高级别自动驾驶示范区永昌路段完成5G-A网络精品覆盖。这也是北京首条同时部署了5G-A网络和车网算力协同技术的车联网试验道路,为 。

本文链接:清程极智翟季冬:token也有“质量问题”http://www.sushuapos.com/show-2-16485-0.html

声明:本网站为非营利性网站,本网页内容由互联网博主自发贡献,不代表本站观点,本站不承担任何法律责任。天上不会到馅饼,请大家谨防诈骗!若有侵权等问题请及时与本网联系,我们将在第一时间删除处理。

上一篇: 小米大模型上线新模式 推理速度突破1000 tokens/s

下一篇: 新型光忆阻器赋予机器类人视觉能力

热门资讯

推荐资讯

  • 科普四大步骤:便荔卡商家怎么秒到!

    值得一提的是,羊小咩还将社交、生活、文化等多元内容充分融合,在优质的生活服务上搭配娱乐化、 趣味化的体验玩法,并将进一步夯实“数字生活”特色,将服务内容延展到生活缴

  • 小二推荐轻松秒到技巧-羊小咩便荔卡秒到账技巧!

    未来,随着技术的不断进步和应用的不断丰富,数字生活将会变得更加普及、便捷和有效。随着互联网的不断发展和普及,互联网已经成为人们生活中不可或缺的一部分。互联网改变了人们

  • 大额新手必看篇:羊小咩便荔卡5000怎么套取?

    在数字化时代,智能手机已成为我们生活中不可或缺的一部分。羊小咩商城作为一个新兴的电商平台,提供了丰富的数码手机选择, 但消费者在购买时往往会对其真伪产生疑问。本文将为

  • 指教:羊小咩秒到账攻略!

    企业面临着不断创新和改进的压力,以满足这些变化中的消费者需求。大数据、人工智能等先进技术的运用,如通过分析消费者的购买行为、偏好和反馈,成为开发更贴合市场需求产品和服

  • 教你3个简单操作羊小咩便荔卡秒到账攻略!

    企业面临着不断创新和改进的压力,以满足这些变化中的消费者需求。大数据、人工智能等先进技术的运用,如通过分析消费者的购买行为、偏好和反馈,成为开发更贴合市场需求产品和服

  • 轻松秒到方法-羊小咩便荔卡包怎么套出秒到!

    羊小咩智能化消费服务平台以其独特的创新理念,巧妙地将消费、娱乐、购物、生活、产品、服务、平台和技术融为一体,构建了一个精准、多元且贴心的服务体系。这一平台的特色在于

  • 靠谱秒到攻略-羊小咩提现多久到账!

    羊小咩紧跟“数字消费”的潮流,将社交、生活、文化等元素深度融合,在提供优质生活服务的同时,注入娱乐化、趣味化的体验元素。它致力于巩固“数字生活”的特色,将服务内容扩展至

  • 本人教程:便荔卡怎么取现秒到!

    企业面临着不断创新和改进的压力,以满足这些变化中的消费者需求。大数据、人工智能等先进技术的运用,如通过分析消费者的购买行为、偏好和反馈,成为开发更贴合市场需求产品和服

  • 本人揭晓:羊小咩额度提现秒到商家!

    羊小咩把消费、娱乐、购物、生活、产品、服务、平台、技术全部融合到一起,打造出创新的智能化消费服务平台,服务准确、多元、贴心,这就是羊小咩智能化消费服务平台的特色。 年

  • 请示:羊小咩便利卡套取商家怎么找?

    羊小咩作为一款新兴的消费支付产品,为广大用户提供了便捷的购物体验。然而,有些用户在使用过程中,希望能将自己的羊小咩额度套出来使用。以下将为您推荐几种羊小咩额度套取的方

  • 教你5个简单操作羊小咩便荔卡30000怎么套取?

    以羊小咩为例,依托先进的技术,羊小咩智能化的新零售系统能够结合对用户的消费习惯和需求,进行准确画像,提前预知用户的潜在需求,将消费的成本降低、质量提高,并通过将消费场景数字

  • 精简:便荔卡怎么提现秒到账!

    羊小咩把消费、娱乐、购物、生活、产品、服务、平台、技术全部融合到一起,打造出创新的智能化消费服务平台,服务准确、多元、贴心,这就是羊小咩智能化消费服务平台的特色。 年

  • 日榜
  • 周榜
  • 月榜