评测背景:为什么选择这个任务?
目前的 LLM 代码评测多依赖纯算法题目或常见 Web 页面,容易面临数据污染问题。而在图形生成领域,简单的静态绘图(如“画一只鸟”或“画一辆车”)往往只需模型检索记忆中的代码片段,难以评估真正的代码推理能力。
“鹈鹕骑自行车”将非标准生物形态、机械传动结构与连续空间运动组合在一起。这个任务无法直接通过复制单一样本完成,且只需在浏览器中运行即可进行客观核验,适合作为评估大模型综合工程能力的复合测试。
这个任务能评测大模型的哪些能力?
- 多重几何与运动学约束求解能力: 模型需要同时满足三层约束:生物解剖比例(喉囊与体型)、机械传动结构(车架与曲柄),以及逆运动学闭环(通过 Two-link IK 等逻辑,确保脚掌持续贴合脚踏且腿长不发生拉伸变形)。
- 空间坐标与三角函数计算能力: 需要在 SVG 屏幕坐标系中准确使用
Math.cos/Math.sin。向右骑行时,脚踏必须沿顺时针方向运行。这考验模型对二维空间坐标变换的数学推导能力。 - 跨领域知识融合能力: 任务要求模型同时掌握生物特征认知、机械传动原理、SVG 路径绘制、动画渲染循环(
requestAnimationFrame)以及 Web Audio 音频合成等技术。 - 单文件完整交付能力: 在不依赖外部库的前提下,输出结构完整、图层清晰、包含交互控制且可直接运行的代码,检验模型的代码架构能力与指令遵循度。
评测标准(满分 100 分)
- 鹈鹕特征(25 分): 长弯喙、下垂的大喉囊、羽翼、身体比例及脚部形态。
- 自行车结构(25 分): 前后轮、轮辐、车架、车座、车把、曲柄、脚踏及传动逻辑。
- 动画与运动学(30 分): 车轮旋转、脚踏沿正确方向转动、双脚持续贴合踏板,髋、膝、踝与脚踏形成闭环。采用 Two-link IK 等方式确保腿长稳定且目标位置成立。
- 交互与视觉(20 分): 场景分层、角色设计、视差背景、播放/暂停、速度调节、主题切换及声音反馈。
注:在 SVG 屏幕坐标中,角色向右骑行时,脚踏必须沿顺时针方向从上方转向前方和下方。此项需要结合 Math.cos / Math.sin 坐标计算进行动态核验。
排名与得分
重点模型表现
gpt-6-astra (98 分)
采用 Two-link IK 逆运动学算法,根据髋部和脚踏位置动态计算膝盖坐标,使大腿与小腿长度保持稳定,脚掌跟随踏板旋转。模型没有简单地让两条腿上下摆动,而是将曲柄轨迹作为腿部运动的硬性约束。同时绘制了海滨、海浪、小船和风力发电机等场景元素,并配备了控制面板。
gemini-3.8-flash-high (98 分)
利用正弦/余弦函数实时计算脚踏位置,左右腿保持 180 度相位差,脚底与踏板始终贴合。车轮、链条与曲柄保持同频转动。喉囊随车身颠簸呈现阻尼回弹效果。此外,该模型利用 Web Audio API 在浏览器端合成了车铃音效。
gemini-3.7-flash-high (98 分)
绘制了半透明喉囊(内有小鱼)、镀铬车架、车灯反光以及时速表和踏频仪。踩踏逻辑采用三角函数计算,曲柄与双腿形成了顺时针运动闭环。
评测结论与观察
- 动态核验是硬指标: 静态截图容易掩盖运动逻辑漏洞。很多模型能在静态下画出鸟和自行车的轮廓,但运行后会出现脚踏原地旋转、脚掌悬空脱离踏板、或车轮转速与踩踏节奏脱节的问题。
- 脚踏闭环依赖逆运动学: 如果没有运动约束,腿部极易出现瞬间拉伸变形或双腿同相位的异常。Two-link IK 能够有效约束腿长与目标点的位置关系。
- 特征识别不可替代: 喙与下垂喉囊的关系、翅膀形状及蹼足共同构成了鹈鹕的辨识度,不能用常规卡通鸟代替。Web Audio、粒子效果和视差背景属于加分项,无法弥补运动逻辑的缺失。
- 代码量与效果不成正比: gpt-6-astra 用相对精炼的代码拿到了 98 分;而 deepseek-v4-pro-0813 虽然场景代码较长,但由于缺失脚部踩踏旋转逻辑,得分仅为 75 分。
