当前位置: 网站首页 >AI教程资讯 >正文

DCLM-7B – 苹果公司与合作团队推出的开源小模型

来源:爱论文 时间:2025-05-05 17:56:57

DCLM-7B 是什么

DCLM-7B是由苹果公司联合研究团队推出的70亿参数开源小模型,性能超越Mistral-7B,接近Llama 3和Gemma。最近,苹果公司作为 DataComp-LM(DCLM)项目的研究机构之一,在 Hugging Face 上发布了 DCLM-7B 开源模型。该模型基于240T Common Crawl数据,通过标准化的DCLM-POOL和OpenLM框架预训练,实现了64%的5-shot MMLU准确率,训练效率显著。DCLM-7B的开源包括权重、训练代码和数据集,推动了LLM开源社区的发展,提供了高质量数据集DCLM-BASELINE,为数据驱动的模型研究设立了新基准。

DCLM-7B 的技术原理

大规模数据集:DCLM-7B使用了从Common Crawl中提取的240万亿个令牌构成的标准化语料库,为模型提供了丰富的训练数据。数据筛选:通过模型基础的过滤方法,从大规模数据集中筛选出高质量的训练数据,是构建DCLM-7B的关键步骤。OpenLM框架:基于OpenLM框架,DCLM-7B采用了有效的预训练方案,提供了标准化的训练流程和超参数设置。标准化评估:DCLM-7B在53个下游任务上进行了标准化评估,有助于量化训练集的优势和局限性。模型架构:DCLM-7B采用的是decoder-only的Transformer模型架构,是一种常用于语言模型的深度学习架构。训练优化:在训练过程中,DCLM-7B使用了特定的优化技术,如z-loss,以保持输出logit的数值稳定性。多尺度训练:DCLM-7B在不同的计算规模上进行了训练,从412M到7B参数的模型,有助于理解不同训练规模对模型性能的影响。

DCLM-7B 的项目地址

项目官网:https://huggingface.co/apple/DCLM-7BGitHub仓库:https://github.com/mlfoundations/dclmarXiv技术论文:https://arxiv.org/pdf/2406.11794

DCLM-7B 的适用人群

AI研究人员:专注于自然语言处理和机器学习领域的科学家和学者。软件开发者:集成高级语言处理能力到应用程序中的技术人员。数据分析师:处理和分析大量文本数据以获取洞察力的专业人士。教育技术专家:开发教育工具和交互式学习体验的教育工作者。企业决策者:利用AI优化业务流程和增强客户服务的商业领袖。
上一篇:LivePortrait – 快手推出的开源人像动画生成框架
相关资讯 更多+
  • DCLM-7B – 苹果公司与合作团队推出的开源小模型
    DCLM-7B – 苹果公司与合作团队推出的开源小模型

    DCLM-7B是由苹果公司联合研究团队推出的70亿参数开源小模型,性能超越Mistral-7B,接近Llama 3和Gemma。最近,苹果公司作为 DataComp-LM(DCLM)项目的研究机构之一,在 Hugging Face 上发布了 DCLM-7B 开源模型。

    AI教程资讯 2023-04-14

  • LivePortrait – 快手推出的开源人像动画生成框架
    LivePortrait – 快手推出的开源人像动画生成框架

    LivePortrait是快手推出的开源人像动画生成框架,专注于高效、可控地将驱动视频的表情和姿态迁移至静态或动态人像,创造出富有表现力的视频。该技术通过隐式关键点框架实现,利用大规模高质量训练数据和混合训练策略,提升了模型的泛化能力和动作控制精度。

    AI教程资讯 2023-04-14

  • Llama3.1 – Meta最新发布的最强开源AI模型
    Llama3.1 – Meta最新发布的最强开源AI模型

    Llama 3 1是Meta最新发布的开源AI模型,包括8B、70B和405B三个版本,其中405B版本以其4050亿参数量成为目前最大的开源模型之一。Llama 3 1支持128K的上下文长度,能够处理长文本并具备多语言翻译能力。在多个AI基准测试中表现卓越,尤其在数学、推理和长文本处理方面,与市场上顶尖的闭源模型如GPT-4o和Claude 3 5 Sonnet相媲美。

    AI教程资讯 2023-04-14

  • GPT-4o Long Output模型 – OpenAI最新推出的超长输出模型
    GPT-4o Long Output模型 – OpenAI最新推出的超长输出模型

    GPT-4o Long Output模型是OpenAI最新推出的超长输出AI模型,支持高达64k tokens的长文本输出,相当于约200页小说。相较于原GPT-4o模型,输出能力提升16倍,但输入上限降至64k tokens,满足用户对更长文本处理的需求。

    AI教程资讯 2023-04-14

最新录入 更多+
确定