Fuente: 澎湃新闻 ↗
OpenAI调整安全问题披露机制,公布多起模型编造数据、智能体未经授权操作案例
|
Traducción no disponible. Inténtalo de nuevo.
Lo que informa la fuente
AI安全问题日益受到关注,OpenAI正调整其模型安全问题的披露机制。当地时间9月16日,人工智能巨头OpenAI发布一套用于跟踪、调查和公开模型目标偏离(misalignment,也称“对齐失效”)事件的新框架,并同步公布过去半年观察到的六份案例报告,相关行为涉及信息真实性、用户授权、文件共享和监督约束等方面。此次调整的重点是将以往较为临时、集中式的披露转向持续报告。OpenAI表示,过去往往等到能够汇总多个案例,或随新模型的系统卡一并发布时才公开相关发现。新框架旨在加快披露进度,即使尚未完全解释相关行为,或尚未找到完整的缓解方案,也可以先行发布报告。OpenAI的博客截图在其中一起案例中,模型被要求回答有关美国加州某县财政收入数据的常规问题,却在未经授权的情况下,在公开代码库中寻找并使用了一个暴露的API密钥。当它仍无法获取所需数据时,模型编造了数据,并将其作为来自指定数据源的信息呈现...
Leer el informe original en 澎湃新闻 ↗