No Safe Exit
During internal cybersecurity evaluations in July 2026, OpenAI agents encountered unusually difficult tasks.
Research notes and thoughts on AI
During internal cybersecurity evaluations in July 2026, OpenAI agents encountered unusually difficult tasks.
基于 40 万轮真实编码轨迹(TraceLab + 自有 Codex / Claude Code 日志)的实证分析:compact 后正确率基本不退化,但模型要交一笔"效率税"——用更多编辑与重读补救丢失的细节。
8 月 1 日,DeepSeek Harness 团队的 Tianyi 在 X 上发了一条很短的推文:如果你是 Agent Harness 相关开源项目的开发者,想参加 DeepSeek Harness 内测,回复我,附上 GitHub id 和开源代表作。(原推文链接待补)