他们主要关注了模型在谄媚行为、告密倾向、自我保护机制、对人类滥用行为的支持,以及破坏AI安全评估和监管相关能力等方面的表现。OpenAI与Anthropic的此次合作,无疑为AI安全测试领域带来了新的启示和思…
除o3外,其他测试模型在一定程度上都存在谄媚行为
作为论坛的开篇,三场主题演讲将从不同维度解构AI开源生态的核心逻辑:蚂蚁集团开源技术委员会副主席王旭将以社区数据为镜,剖析全球大模型开源生态的全景与趋势,为技术决策提供中立参考;魔搭社区产研负责人陈颖达将结…
06/25 00:17
06/25 00:16
06/25 00:15