OpenAI 发布 HealthBench:一个面向医疗问诊的大模型评估基准
·
在大语言模型迅速发展的背景下,医疗领域的应用安全与可靠性亟需系统性评估。OpenAI 近日发布了开源评估基准 HealthBench,用于衡量大模型在医疗场景中的实际表现。
该基准由 262 位医生参与设计,涵盖 5000 个多轮对话场景,设置了超过 4.8 万个细致的评估维度。评估重点包括准确性、指令遵循、沟通能力等,场景涵盖急诊、临床数据转换、全球健康等。
对开发者和研究者而言,HealthBench 提供了一个高质量、可重复的测试框架,适合用于模型微调、评估和安全性验证。
原文链接:https://openai.com/index/healthbench/
步骤:
1-扩展程序飞书剪存存文档到飞书,飞书导出word文档
2-基于博主@歸藏的AI工具箱 的提示词+cluade 3.7输出了下面的这份HTML




魔乐社区(Modelers.cn) 是一个中立、公益的人工智能社区,提供人工智能工具、模型、数据的托管、展示与应用协同服务,为人工智能开发及爱好者搭建开放的学习交流平台。社区通过理事会方式运作,由全产业链共同建设、共同运营、共同享有,推动国产AI生态繁荣发展。
更多推荐


所有评论(0)