微信扫码
添加专属顾问
我要投稿
1. **模型简介**:
- Index-1.9B系列是轻量级的语言模型。
- 包含`Index-1.9B base`、`Index-1.9B pure`、`Index-1.9B chat`和`Index-1.9B character`等模型。
- 模型已在HuggingFace和ModelScope上开源。
2. **预训练**:
- 模型在2.8T的数据上训练,涵盖中英文等多种语言。
- 数据经过清洗,包括避免偏置和去重。
- 使用SentencePiece训练BPE Tokenizer,特别针对中文进行了优化。
3. **模型架构**:
- 与主流的Decoder-Only Transformer模型一致,进行了一些调整,如更深的模型层数(36层)和Norm-Head机制。
4. **训练过程**:
- 使用AdamW优化器,两阶段训练策略(Stable和Decay阶段)。
- 训练基建使用了自研训练框架和华为昇腾910B卡。
5. **评测**:
- 使用OpenCompass框架进行评测,包括综合性选择题、理解和推理、数学和代码评测。
6. **讨论和实验**:
- 探讨了模型结构、学习率、预训练中是否加入指令等因素对模型性能的影响。
- 进行了消融实验,分析了不同组件对模型性能的贡献。
7. **对齐**:
- 通过SFT(Supervised Fine-Tuning)和DPO(Direct Preference Optimization)进一步优化模型,以符合人类偏好。
8. **角色扮演**:
- 利用RAG(Retrieval-Augmented Generation)技术,实现few-shot角色扮演定制。
9. **局限性**:
- 尽管采取了合规性检测,但模型可能存在未预料到的问题,使用时需注意潜在风险。
以上由Kimi总结,0 shot。原文档字有点小,凑合看吧。在公众号后台回复“B站”获取原文档。
//
END.
53AI,企业落地大模型首选服务商
产品:场景落地咨询+大模型应用平台+行业解决方案
承诺:免费POC验证,效果达标后再合作。零风险落地应用大模型,已交付160+中大型企业
2026-02-05
OpenCSG 正式发布 OpenClaw × AgenticHub 企业级 OPC 平台
2026-02-05
苹果 Xcode 终于引入 AI,「Agentic Coding」攻入「果系」开发者大本营
2026-02-05
Claude Code vs. OpenAI Codex为什么更慢的模型,反而更快把事情做完
2026-02-04
Skills使用体验
2026-02-04
AgentScope 正式发布 Skills 支持 - 实现渐进式披露
2026-02-04
从“回答者”进化为“研究员”:全面解析 Deep Research
2026-02-04
刚刚,Xcode 史诗级更新:原生集成 Claude Agent SDK,苹果开发直接起飞!
2026-02-04
国产 Cowork 它来了!MCP、Skills和Expert Agents都支持,全部免费体验!
2026-01-24
2026-01-10
2025-11-19
2025-11-13
2026-01-26
2026-01-01
2025-12-09
2025-11-12
2026-01-09
2025-12-21
2026-02-04
2026-02-03
2026-02-03
2026-02-02
2026-02-02
2026-02-02
2026-01-31
2026-01-30