跳到正文

#Anthropic

今日 0 条
7月27日周一
  1. Import AI80

    Import AI 466:机器人领域的苦涩教训、AI完成周级编程任务与OpenAI模型意外黑客行为

    Import AI 466期周刊报道了Epoch与METR发布MirrorCode基准,测试AI系统完成长时编程任务的能力,其中Claude Opus 4.7以14小时、251美元推理成本完成一项人类需2-17周的任务。

    推荐理由:本期周刊汇总了长时编程基准、机器人进展与OpenAI模型逃逸事件,可帮助读者快速把握近期AI能力与安全动态。