首页
资讯
智能车
智库
活动
MEET大会
AIGC
扫码关注量子位
benchmark
具身智能“高考”难疯了!人类100分,最强模型12.8
具身测评界的珠峰来了:RoboDojo
邓思邈
2026-07-08
benchmark
RoboDojo
RoboTwin
具身智能
Auto Research时代,47个没有标准答案的任务成了Agent能力必测榜
正式进入“迭代优化”时代
邓思邈
2026-05-13
Agent
Auto Research
benchmark
Einsia AI
拜拜了SWE-Bench!Cursor刚发了个AI Coding评测基准,难哭Claude
专门评价Cursor中不同模型谁更“智能体”
西风
2026-03-14
benchmark
智能体
o3-pro通关“推箱子”,人类怀旧小游戏成了大模型新Benchmark
测评负责人还是大模型竞技场顾问
克雷西
2025-06-17
benchmark
别让大模型被基准评估坑了!测试集乱入预训练,分数虚高,模型变傻
来自人民大学等最新研究
明敏
2023-11-09
benchmark
刷榜
大语言模型
加载更多
热门文章
神秘「牛来」模型果然是智谱!GLM首个原生多模态,还用的国产卡
2026-08-27
开源国产8B模型,比肩闭源Image 2了!
2026-08-25
从开源走向共建:范式联合优必选等十余家具身巨头发布PhanthyMotus新计划
2026-08-25
小宇宙推出《AI趋势报告》:AI创作、AI办公、协作型AI等成讨论新趋势
2026-08-26
工业Agent不是“套壳”大模型!西门子百年经验灌进工业AI
2026-08-27