
来源:Aiyxl/Jimeng AI
拉脱维亚语言技术公司Tilde在2025年9月3日发布了开源大语言模型TildeOpen LLM。该模型由欧盟超级计算机加持,拥有300亿参数,专门为欧洲语言设计,特别是那些较少被代表的国家和地区语言。它是在欧洲超级计算机LUMI(芬兰)和JUPITER上训练的。 模型采用了CC-BY-4.0宽松许可证,允许用户自由使用和修改。

全球AI竞赛正迎来新参与者,不再只是中美科技巨头间的游戏。瑞士不久前也推出了国家级开源大语言模型Apertus。瑞士的Apertus由公立机构打造,完全开源,训练数据涵盖1000多种语言,总token量达15万亿,其中非英语数据占比40%。与此同时,中国企业也在积极行动。美团刚刚发布了5600亿参数的龙猫大模型(LongCat-Flash-Chat),并在GitHub和Hugging Face等平台上同步开源。
TildeOpen LLM是一个拥有300亿参数的稠密解码器模型。它支持包括阿尔巴尼亚语、保加利亚语、克罗地亚语、捷克语等32种欧洲语言。与传统主流模型相比,TildeOpen的创新在于其“公平的标记器”设计。这个标记器使不同语言的文本以相似方式表示,减少标记数量,提高推理效率。
多语言平衡训练是另一个核心特点。训练过程包含三阶段采样:首先在语言间均匀分布,其次对高数据量语言的自然分布进行增强,最后再进行均匀扫查以确保平衡。
TildeOpen LLM通过受EleutherAI启发的GPT-NeoX脚本进行训练,共进行了45万次更新,使用了约2万亿个令牌。模型的超参数包括60层、嵌入维度6144、48个注意力头、8192-token的上下文窗口,以及使用SwiGLU激活、RoPE位置编码和RMSNorm层规范化。训练使用了欧盟委员会大型人工智能大奖挑战赛提供的**200万GPU小时的计算资源**,这些计算资源是在欧洲的超级计算机LUMI(芬兰)和JUPITER上完成的。
主流大语言模型通常严重偏向英语和其他主要语言。 90%的LLM训练数据是英语,导致对小语言支持不足。这种偏向性导致处理波罗的海、斯拉夫及其他较小的欧洲语言时表现不佳,常常出现语法错误、奇怪措辞和幻觉问题。TildeOpen通过技术创新解决了这一痛点。其“公平的标记器”设计确保了不同语言都能获得相对公平的表示,提高了小语种处理的准确性和效率。
TildeOpen LLM的一个重要特点是强调数据主权和合规性。组织可以选择在本地数据中心或符合欧盟要求的安全云中自我托管。这一特性确保了遵循GDPR及其他数据保护法规,解决了与美国或亚洲托管模型相关的主权问题。对于欧洲政府和企业来说,这意味着敏感数据可以完全留在境内。瑞士银行家协会此前曾指出,本土研发的大语言模型具有“巨大的长期潜力”,因为这类模型能更好地契合严格的本地数据保护法规与银行保密制度。
TildeOpen作为基础模型,能够支持多种应用场景。客户支持自动化是其中之一,企业可以构建多语言客户服务助手。文档分析工具是另一个重要应用场景,可以提取关键信息并协助监管流程,同时保持安全性。在法律和合规领域,它能够加速起草和分析工作。内容创建和翻译服务也是核心应用场景。该模型支持翻译、本地化和多语言内容生成,帮助企业进行国际扩张。
TildeOpen LLM代表了欧盟对人工智能的战略视野——不仅是监管合规,更是技术管理。它是欧盟迈向语言平等和数字主权的重要一步。拉脱维亚通过Tilde的努力,正在将自己定位为技术出口国,希望扩大欧洲人工智能基础设施的规模,同时保持语言多样性。这一项目也得到了欧盟委员会的支持,通过授予超级计算机访问权限和计算资源,表明欧盟正在积极推动数字主权和技术自主。
TildeOpen采用CC-BY-4.0宽松许可证,允许自由使用和修改。这种开放策略有助于加速创新和采用。作为基础模型,TildeOpen预计会推出更多专门化版本,例如经过指令调优的翻译模型,这将进一步增强其功能。开源模式也使研究机构和企业能够基于TildeOpen构建自己的专业模型,推动整个欧洲AI生态系统的发展。TildeOpen LLM已部署在Hugging Face平台上,供开发者自由使用。拉脱维亚这个小国通过Tilde的努力,正将自己定位为技术出口国。
欧盟委员会的支持使得Tilde能够使用世界级的超级计算资源,体现了欧洲在数字主权和语言多样性方面的集体承诺。随着更多专门化版本的出现,TildeOpen可能将成为欧洲多元语言生态的技术基石。
Huggingface:
https://huggingface.co/TildeAI/TildeOpen-30b