首页 科技快讯 苹果发布语言模型OpenELM:基于开源训练和推理框架

苹果发布语言模型OpenELM:基于开源训练和推理框架

来源:晰数塔互联网快讯 时间:2024年04月27日 12:51

来源:环球网

【环球网科技综合报道】4月25日消息,苹果公司于日前发布一个名为OpenELM的高效语言模型,具有开源训练和推理框架。

苹果方面表示,“大型语言模型的可重复性和透明性对于推进开放研究、确保结果的可信度以及调查数据和模型偏差以及潜在风险至关重要。为此,我们发布了 OpenELM。”

据介绍,OpenELM使用分层缩放策略,可以有效地分配Transformer模型每一层的参数,从而提高准确率。例如,在参数量约为10亿的情况下,OpenELM与OLMo 相比准确率提升了2.36%,同时所需的预训练 tokens 数量为原来的50%。

“与以往只提供模型权重和推理代码并在私有数据集上进行预训练的做法不同。”苹果官方指出,“我们发布的版本包含了在公开数据集上训练和评估语言模型的完整框架,包括训练日志、多个检查点和预训练配置。我们还发布了将模型转换为 MLX 库的代码,以便在苹果设备上进行推理和微调。此次全面发布旨在增强和巩固开放研究社区,为未来的开放研究工作铺平道路。”

据悉,这是一项开源语言模型,其源码及预训练的模型权重和训练配方可在苹果 Github库中获取。

发布于:北京

相关推荐

苹果发布语言模型OpenELM:基于开源训练和推理框架
苹果一次性开源8个大模型,为WWDC做准备?
AI iPhone怎么做?苹果给出了一些答案
ChatGPT即将登陆iPhone,苹果接近与OpenAI达成协议
打破瓶颈,让RAG学会思考:中科大、智源等发布推理检索框架BGE-Reasoner
一场35分钟的发布会,藏着苹果的野心与妥协
大语言模型会推理吗?
DeepSeek开源新模型,数学推理能力大提升
字节突然开源Seed-OSS,512K上下文碾压主流4倍长度,推理能力刷新纪录
超越DeepSeek-V4!罗福莉交出小米最强开源模型,首日适配5家国产芯片

网址: 苹果发布语言模型OpenELM:基于开源训练和推理框架 https://www.xishuta.cn/newsview116632.html

所属分类:行业热点

推荐科技快讯