哔哩哔哩开源Index-Translate翻译模型,文本模型覆盖150种语言

9月30日,哔哩哔哩Index LLM团队发布Index-Translate模型,2B、9B、35B-A3B(preview)文本模型权重已在Hugging Face与ModelScope开放。该模型家族基于Qwen3.5构建,文本模型支持包括中文、英文在内的150种语言,并支持术语、格式、保留内容等翻译指令。

哔哩哔哩开源Index-Translate翻译模型,文本模型覆盖150种语言

Index-Translate家族包含多个子模型。其中,Index-Translate用于翻译文本、结构化内容与社区表达;Index-Echo可生成目标语言字幕或配音,配音时参考源语音的说话人声音特征;Index-Homura能根据指定目标音节数调整译文;Index-NativeLong输入完整文档,利用上下文维持前后联系。

官方案例展示了具体效果。在游戏社区语境中,“狒瘾犯了就去打”被Index-Translate-9B译为“When the FFXIV itch hits, just go play.”,Index-Translate-2B也给出了相近含义,而对比模型Hy-MT2-7B误译为“If you get monkey addiction, go fight.”。Index-Homura-9B对“生活两天,是一种什么体验”按10、14、18个目标音节生成了三种英文表达。

长文档翻译测试中,一篇约32K tokens的奇幻文本里“王妃”作为人物姓名,Index-NativeLong-9B在31.3%、56.6%、84.8%的位置均保持为“Wang Fei”,而同一9B模型的分块翻译分别出现“Instructor Wangfei”“the Dean”“The Queen Consort”。模型Demo、GitHub仓库及权重下载地址已在Hugging Face和ModelScope公开。