跳到正文
Bubble's Brain
搜索
⌘K
教程
精选阅读
Vibe Coding
Benchmarks
EN
登录
·
账户
正在检查登录状态…
使用 Google 登录
退出登录
重试
教程
精选阅读
Vibe Coding
Benchmarks
更新日志
关于
English
Benchmarks
评测
实测案例
综合能力
Artificial Analysis Intelligence Index
Artificial Analysis
综合智力:知识、推理、数学、编程混在一起的总分
GDPval-AA v2
Artificial Analysis
真实职场任务:能否交付可用的文档、表格、幻灯片和图示
Vals Index
Vals AI
综合金融、编程与法律任务,按行业经济权重衡量 Agent 的工作能力
Coding
Terminal-Bench 4.0
tbench.ai
Agent 能力:在真实终端里独立完成任务
DeepSWE v1.1
Datacurve · DeepSWE
软件工程能力:在真实代码库中完成长流程、多文件的开发任务
ProgramBench
ProgramBench · Meta / Stanford / Harvard
从零开发能力:只运行参考程序、阅读文档,重建行为一致的软件
FrontierSWE v2
Proximal Labs · FrontierSWE
长时间工程能力:在 20 小时内完成高难度软件、科研与视觉任务
金融
Finance Agent v2
Vals AI
像金融分析师一样查财报、核对数据,并完成多步分析与计算
数据核对于 2026.09.07
⌘K
搜索知识库
关闭搜索
Esc
搜索文章
最近收录
正在载入知识索引…