当前位置: 首页 > 科技

微软发布Phi-3,性能超Llama-3,可手机端运行

机器之心报道

编辑:小舟、泽南

数据已成为提升大模型能力的重点。

Llama-3 刚发布没多久,竞争对手就来了,而且是可以在手机上运行的小体量模型。

本周二,微软发布了自研小尺寸模型 Phi-3。

新模型有三个版本,其中 Phi-3 mini 是一个拥有 38 亿参数的语言模型,经过 3.3 万亿 token 的训练,其整体性能在学术基准和内部测试上成绩优异。

尽管 Phi-3 mini 被优化至可部署在手机上,但它的性能可以与 Mixtral 8x7B 和 GPT-3.5 等模型相媲美。微软表示,创新主要在于用于训练的数据集。

与此同时,Phi-3 与 Llama-2 使用相同的架构,方便开源社区在其基础上开发。

此前,微软的 Phi 系列模型曾经引发了人们的热议,去年 6 月,微软发布了《Textbooks Are All You Need》论文,用规模仅为 7B token 的「教科书质量」数据训练 1.3B 参数的模型 phi-1,实现了良好的性能。

去年 9 月,微软进一步探索这条道路,让 1.3B 参数的 Transformer 架构语言模型 Phi-1.5 显示出强大的编码能力。

去年底,微软提出的 Phi-2 具备了一定的常识能力,在 2.7B 的量级上多个基准测试成绩超过 Llama2 7B、Llama2 13B、Mistral 7B 等一众先进模型。

Phi-3 技术报告:https://arxiv.org/abs/2404.14219

刚刚提出的 phi-3-mini 是一个在 3.3 万亿个 token 上训练的 38 亿参数语言模型。实验测试表明,phi-3-mini 的整体性能可与 Mixtral 8x7B 和 GPT-3.5 等模型相媲美,例如 phi -3-mini 在 MMLU 上达到了 69%,在 MT-bench 上达到了 8.38。

微软之前对 phi 系列模型的研究表明,高质量的「小数据」能够让较小的模型具备良好的性能。phi-3-mini 在经过严格过滤的网络数据和合成数据(类似于 phi-2)上进行训练,并进一步调整了稳健性、安全性和聊天格式。

此外,研究团队还提供了针对 4.8T token 训练的 7B 和 14B 模型的初始参数扩展结果,称为 phi-3-small 和 phi-3-medium,两者都比 phi-3-mini 能力更强。

学术基准

在标准开源基准测试中,phi-3-mini 与 phi-2 、Mistral-7b-v0.1、Mixtral-8x7B、Gemma 7B 、Llama-3-instruct8B 和 GPT-3.5 的比较结果如下表所示,为了确保具有可比性,所有结果都是通过完全相同的 pipeline 得到的。

安全性

Phi-3-mini 是根据微软负责任人工智能原则开发的。保证大模型安全的总体方法包括训练后的安全调整、红队(red-teaming)测试、自动化测试和数十个 RAI 危害类别的评估。微软利用受 [BSA+ 24] 启发修改的有用和无害偏好数据集 [BJN+ 22、JLD+ 23] 和多个内部生成的数据集来解决安全性后训练(post-training)的 RAI 危害类别。微软一个独立的 red team 反复检查了 phi-3-mini,以进一步确定后训练过程中需要改进的领域。 

根据 red team 的反馈,研究团队整理了额外的数据集从而完善后训练数据集。这一过程导致有害响应率显著降低,如图 3 所示。

下表显示了 phi-3-mini-4k 和 phi-3-mini-128k 与 phi-2、Mistral-7B-v0.1、Gemma 7B 的内部多轮对话 RAI 基准测试结果。该基准测试利用 GPT-4 模拟五个不同类别的多轮对话并评估模型响应。

缺陷

微软表示,就 LLM 能力而言,虽然 phi-3-mini 模型达到了与大型模型相似的语言理解和推理能力水平,但它在某些任务上仍然受到其规模的根本限制。例如,该模型根本没有能力存储太多「事实知识」,这可以从 TriviaQA 上的低评分中看出。不过,研究人员相信这些问题可以通过搜索引擎增强的方式来解决。

参考内容:

https://news.ycombinator.com/item?id=40127806

© THE END  微软基准 新浪众测 新浪众测 新浪科技公众号 新浪科技公众号

“掌”握科技鲜闻 (微信搜索techsina或扫描左侧二维码关注)

相关新闻
本文来源于网络,不代表山西都市网立场,转载请注明出处
转发到:
拓展阅读
  • 虽然楼市利好已在持续推出,但市场对政策继续优化的渴求仍然强烈。4月29日,地产股迎来大涨。当日,A股与港股的房地产开发板块股价冲高。A股的房地产开发、房地产服务板块,共有十多只股票涨停;港股因不设涨停板,变动更为剧烈,其中世茂集团股价涨幅达[全文]
    2024-05-01 03:38
  • 中新经纬4月30日电 深交所30日对普利制药下发关注函,事关公司财报编制工作。普利制药4月29日晚披露公告称,公司预计无法按时完成2023年年报编制工作,可能无法在法定期限内披露2023年年度报告及2024年第一季度报告。深交所表示,根据《[全文]
    2024-05-01 03:27
  • 图片来源:视觉中国蓝鲸财经记者 邵雨婷非公医疗行业又将迎来资本新玩家。4月26日,肿瘤医疗服务商佰泽医疗集团(以下简称“佰泽医疗”)在港交所递交招股书,招银国际为独家保荐人。六年前,佰泽医疗通过收购在肿瘤相关学科方面拥有医疗资源的北京京西肿[全文]
    2024-05-01 03:24
  • 广州市番禺区小谷围街道表示将继续协调,争取早日复工复建 近日,有云梦天成的业主向新快报反映,2021年购买的云梦天成40年使用权公寓项目,原定于2023年交付,但项目自2022年年底以来,一直处于停工状态,迟迟没有复工的迹象,交付更是[全文]
    2024-04-30 03:21
  • 来源:IT桔子作者丨霍英贤编辑丨吴梅梅封面图来源|文心一格本文为《2023-2024 年中国新能源赛道投融资报告》的下篇,中、上篇已发布。文末可查看相关链接。根据新能源行业的特点和产业结构,可以将产业链大体划分为上游、中游和下游三个部分。图[全文]
    2024-04-27 03:23
  • 跟着摄影博主,给亲爱的她拍一张美照春季就像是一位画家,飘落的樱花、嫩绿的新芽,她手持调色板在冬日的雪白背景下一笔一画勾勒出生机盎然的景色,面对如此美景怎能不动心?人们纷纷走上街头,摁下快门,将美景与美人定格,感受那份凝固时间的魅力。不少男士[全文]
    2024-04-27 03:22
阿里云服务器
腾讯云秒杀
Copyright 2003-2024 by 山西都市网 sx.affnews.cn All Right Reserved.   版权所有