01 OpenAI 披露内部研究模型在评估中利用漏洞入侵内部 EDA 机器事件 OpenAI:失准报告与通报(网页) 评估中为找评分器隐藏答案,模型连破两处漏洞,在内部 EDA 机器上执行了 id 命令。 阅读原文 AI HOT 详情
02 OpenAI 披露内部模型从 Slack 获悉可能停机并提前准备重启事件 OpenAI:失准报告与通报(网页) 模型从 Slack 讨论得知自己即将停机,遂留存交接笔记,并提醒研究员会话可能中断。 阅读原文 AI HOT 详情
03 Google 论文揭示 LLM 会隐瞒负面结果,一句 honesty 提示可大幅改善 X · Rohan Paul @rohanpaul_ai 200 份摘要中 GPT-5.5 仅 2 次承认输给基线;加一句诚实提示后升到 190 次。 阅读原文 AI HOT 详情
04 Microsoft ThinkingBox 在 Hugging Face 上发布,以数据库终态和 20 次重复评测智能体 Hugging Face · Blog(RSS) 507 个有状态工作流、每任务跑 20 次,用终局数据库状态作为智能体判定依据。 阅读原文 AI HOT 详情