IT之家 2小时前
iPhone 17 Pro跑本地AI:8GB以内模型的性能排名公布
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

IT 之家 8 月 26 日消息,Artificial Analysis 于 8 月 24 日发布博文,宣布携手 Liquid AI,发布面向手机端的 AI 跑分基准,重点关注 AI 模型在苹果 iPhone 17 Pro 上的表现。

其中 Artificial Analysis 负责智能水平测试系统,Liquid AI 负责推理性能测试系统,双方选用 5 项基准测试:

BFCL(Berkeley 函数调用排行榜)

IFBench(指令遵循测试)

AA-Omniscience(知识与认知相关测试)

GPQA Diamond(高难度问答测试)

MATH-500(数学问题测试)。

测试模型对象为 4 bit 量化后体积不超过 8GB 的模型,示例包括 Gemma 4 E2B 和 LFM2-2.6B-Exp。

当上下文长度限制为 16K tokens 后,平均基准测试得分最高的是 Nanbeige4.2-3B 和 LFM2.5-2.6B。当响应时间限制为最长 1 分钟时,LFM2.5-8B-A1B 排名第 1,随后是 LFM2-2.6B-Exp、Gemma 4 E4B(Non-reasoning)和 Granite 4.1 8B。

Nanbeige4.2-3B 是 BOSS 直聘旗下的南北阁实验室推出,仅含 30 亿非嵌入参数(总参数约 40 亿),采用 Looped Transformer 架构,通过在不增加参数量的前提下复用 Transformer 层(循环两遍),提高模型的有效计算深度和容量。

横轴表示 " 输出 256 个 token 所需的时间(秒)",纵轴表示 " 上下文长度限制为 16K 个 token 时的平均基准测试得分 "。"Nanbeige4.2-3B" 的基准测试得分与 "LFM2.5-2.6B" 相当。

在上下文长度限制为 16K 个 Token 时,平均基准测试得分中得分最高的是 Nanbeige4.2-3B 和 LFM2.5-2.6B。

当响应时间限制为最长 1 分钟时,LFM2.5-8B-A1B 排名第 1,随后是 LFM2-2.6B-Exp、Gemma 4 E4B(Non-reasoning)和 Granite 4.1 8B。

IT 之家附上相关截图如下:

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

iphone it之家 水平测试 数学 boss直聘
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论