Skip to the content.

从 80 条内容中筛选出 2 条重要资讯。


AI 创作者雷达

  1. OpenAI 发布心理健康基准 MentalHealthBench ⭐️ 7.0/10
  2. Anthropic 实验:Claude 代理替员工在市场换书 ⭐️ 7.0/10

AI 创作者雷达

OpenAI 发布心理健康基准 MentalHealthBench ⭐️ 7.0/10

OpenAI 发布开放基准 MentalHealthBench,用于评估 AI 在真实心理健康对话中的回应表现,由 22 个国家/地区的 80 多名持证心理健康专家共同制定。该基准衡量的行为包括安全、收集背景信息、维护用户自主权和提供可行建议,场景覆盖成人、青少年、照护者和临床人员。OpenAI 表示结果显示 AI 应对心理健康问题取得了稳步进展,同时说明 ChatGPT 不能替代专业治疗。材料未给出基准的题目数量、评分方式、发布日期,也未提供可量化的对比基线。

telegram · zaihuapd · 9月24日 06:00

「为什么值得关注」 材料显示这是 OpenAI 官方新发布的开放基准,并把心理健康对话的评测拆成安全、背景收集、用户自主权和行动建议等具体维度,为 AI 安全与评测方法的讨论提供了可对照的抓手。至于模型在心理健康场景中的实际能力变化,目前只有“稳步进展”这一表述,尚无量化结果可验证。

「可做角度」 可做角度:拆解 MentalHealthBench 列出的四类评测行为,讨论“由多国持证专家制定的对话标准”能否转化为可复现、可自动化的评分指标,以及 22 个国家/地区专家共同参与这一设计,对跨文化心理健康场景的评测意味着什么。

标签: #OpenAI, #MentalHealthBench, #AI心理健康, #AI基准评测, #AI安全


Anthropic 实验:Claude 代理替员工在市场换书 ⭐️ 7.0/10

Anthropic 用 201 名员工作了一项实验:每人与 Claude 简短聊天后带上一本书,再由代理组成的市场互相议价换书,目标是带回想读的书。结果称,仅凭约五分钟聊天,Claude 对书单的排序与本人有 61% 一致;市场未达到最优主要缘于代理对参与者了解不足,而非谈判不力。模型越强时成交效率越高,参与者平均满意度为 7.2/10,并表示愿把约三成年度购书预算交给代理。该描述来自 Telegram 转述的 Anthropic 官方实验,具体统计口径与实验设置应以 Anthropic 原始研究为准。

telegram · zaihuapd · 9月25日 04:40

「为何值得注意」 它把一个常被讨论的问题摆到了可测量的位置:当 AI 代理代表用户进入议价场景时,制约效率的可能是对用户偏好的理解,而不是谈判技巧本身。需要说明的是,这是一项研究演示,并非模型或产品的实质发布,对普通用户和开发者的直接影响有限。

「内容角度」 可做角度:把「让代理替我买东西」的瓶颈从「它会不会砍价」挪到「它到底懂不懂我想要什么」,用 61% 的排序一致率与 7.2/10 的满意度这两个数据,讨论偏好采集环节的局限,并明确这只是 Anthropic 的内部实验,不构成对现有产品能力的承诺。

标签: #Anthropic, #Claude, #AI代理, #多代理市场, #人机偏好对齐