魅力生活

首页 > 魅力生活

Kakao降低大模型训练成本 推动AI模型轻量化

新闻发布 [2026-10-08 10:05] 翻译: among2008@asiatoday.co.kr
放大 缩小 打印 weibo
KAKAO

Kakao在国际学会上公开了降低大规模语言模型(LLM)训练成本、实现模型轻量化的人工智能(AI)研究成果。公司展示了以较低成本预测大模型训练所需最佳设置,以及在缩小模型规模的同时提升性能的技术。

 

Kakao 8日表示,公司在语言模型国际学会“COLM(Conference on Language Modeling)2026”主会场以及分词工作坊“TokShop”上发表了相关研究成果。

 

在主会场,Kakao介绍了一种方法,可用约占整体训练成本1%的费用,预测大规模专家混合(MoE)模型的最佳学习率。学习率是决定AI模型在训练过程中参数调整幅度的数值,会影响训练稳定性和模型性能。

 

Kakao将从小型模型中找到的最佳训练设置扩展至大型模型的“μ-参数化(μ-Parameterization)”技术应用于MoE架构。公司通过逐步增加模型规模和训练Token数量寻找适当的学习率,并验证在较短训练阶段获得的设置是否同样适用于大规模训练。

 

据Kakao介绍,该方法还被应用于其“Kanana-2.6-155b-a17b”模型的预训练,使模型能够稳定完成规模达到10万亿Token的训练。

 

在TokShop上,Kakao公开了在缩小模型规模的同时提升性能的“BBT(BPE-Guided Byte Transformer)”架构。与传统BPE方式存储对应单词或词片段的信息不同,BBT利用更小的基本单位——字节,从而缩小模型规模。

 

对比实验显示,在将参数数量减少20.2%至40.4%的同时,测试性能提高了2.7%至6.6%。此外,模型应对错别字或字符扰动的能力,以及向未接受训练的语言进行迁移的性能也有所提升。

 

Kakao认为,这项技术可用于减轻设备端AI模型的内存负担,并帮助模型在多语言输入或错别字较多的对话环境中保持稳定性能。

 

Kakao计划今后将研究应用范围扩大至多种模型架构以及多模态、多语言环境,降低大型语言模型的训练及运行成本。

Kakao相关人士表示:“此次研究的意义在于提出了在保持或提升AI模型性能的同时降低训练和运行成本的方法。今后,我们将把研究拓展至多种模型架构以及多模态、多语言环境,提高其在实际服务中的应用可能性。”

 

孙康勋 记者 

国际热点