Qwen3.8-27B在标准部署下哪款框架吞吐表现最好?
测试中vLLM平均吞吐约41.77 token/s,SGLang约40.06 token/s,两者基本在同一档,明显优于Llama.cpp的23.50 token/s。

作者丨 吴海明 何宇轩 编辑丨李娜 岑峰
雷峰网对阿里开源的Qwen3.8-27B模型进行本地实测,从标准部署、量化部署到Agent场景多维测评。结果显示其性能强劲,标准部署下vLLM与SGLang吞吐超40 token/s,3bit至6bit量化质量稳定,Agent任务质量满分但token消耗与耗时极高,复杂任务拆解与执行控制不足,需工程化约束才能作为高效Agent底座。
测试中vLLM平均吞吐约41.77 token/s,SGLang约40.06 token/s,两者基本在同一档,明显优于Llama.cpp的23.50 token/s。
在本轮的7道文本任务中,3bit至6bit均拿到满分14/14,2bit出现事实修正错误,8bit也有类似问题,16bit则在篇幅控制上失守。
它完成9个任务耗时约6小时17分钟,消耗近1400万token,其中3D网站生成单题就烧掉1153万token。问题在于任务拆分过细但单步目标过重、上下文反复回灌,导致大量空转和算力浪费。
HYROX比赛腹泻这事,运动员拼归拼,但主办方不能装看不见
Claude在英伟达内部被限用,黄仁勋告诉特朗普:我们不会让AI发展放缓发生
清华稳准智能联合发布LimiX-2,结构化数据基础模型登顶国际评测榜单首个AIGC长片大赛!RunningHub单项大奖100万,科幻IP免费改编豆包手机明日开卖,AI能帮你操作App了吗?清华稳准智能联合发布LimiX-2,结构化数据基础模型登顶国际评测榜单
AI 减速还是不减速:一场周末点燃的行业与政府对垒
Xspark AI 丁文伯:触觉替代不了视觉,但机器人需要一套自己的“脊髓” |物理AI 50人
我和我的 AI 手机吃了 3 顿饭
当AI能解千禧难题,再次证明答案不再是门槛
超级智能体“迪迪虾”上车,比亚迪携手阿里云推进智能座舱升级
“阿宝”交新朋友:携手比亚迪“迪迪虾”,实现车机端一句话办事Build an AI-powered product tagging system with Amazon SageMaker serverless model customization
读完斯坦福116页AI实施手册,我最大的感受是:别再盯着模型了
拼多多链接裂变玩法
推特创始人谈“AI减速”论:前沿不属于任何一家公司地平线第1500万颗征程芯片搭载大众 ID. AURA T6,HSD V2.1 即将推出
产品定义意义上的一级场景:四维模型
Anew Labs已完成 2.9 亿美元融资,红杉中国、高瓴、IDG、五源、高榕等参与
HTTP 新增 QUERY 方法:有人叫好,也有人质疑“这不就是 GET?”Denuvo 起诉黑客违反 DMCA 反规避条款
数亿元!前京东副总裁“消失”4年:不造会跑的天工,他在仓库里给人形机器人“占工位”从前沿技术到产业资本,2026产业未来大会看见「深水之上」支付宝 xUI -- “阿宝”背后的 Agentic 终端交互引擎
How NVIDIA Groq 3 LPX Deterministic Execution Drives Power-Efficient High-Interactivity Inference on NVIDIA Vera RubinMozilla 报告称中国开放权重模型与美国前沿模型仅相差 4.4 个月
被AI放大的光学「戏份」,让「配角」舜宇的生意越做越大
破局产品同质化:长期主义的产品突围之路
旗舰SoC进入融合计算时代,天玑9600 Pro首创AI原生架构!