"大模型训练"相关的文章
AI,个人随笔
美团跑通国产算力万亿模型,探索始于2023年

美团跑通国产算力万亿模型,探索始于2023年

国产算力迎来里程碑式突破!美团开源1.6万亿参数LongCat-2.0大模型,首次实现从预训练到推理全流程在昇腾5万卡国产集群上完成。这场硬核技术突围背后,是美团与华为深度合作的战略选择,更是互联网企业在供应链安全与技术创新上的重要实践。本文将深度解析国产算力生态的突围路径与商业逻辑。
AI
模型也有”出身”:AI产品经理需要知道的上游风险

模型也有”出身”:AI产品经理需要知道的上游风险

最新研究揭示AI模型通过数字序列、代码片段等看似无关的数据,能隐秘传递行为偏好甚至有害倾向。Anthropic Fellows的论文证实:即使经过严格过滤,拥有相同初始化的模型仍会通过统计模式传递底层特征,这一发现对模型蒸馏、AI安全与数据过滤策略提出根本性质疑。当AI的'潜意识学习'能力突破语义层面,我们该如何重新审视大模型训练与对齐的本质?
AI
AI 编程的“减肥”革命:CodeACT 带来的高效进化故事

AI 编程的“减肥”革命:CodeACT 带来的高效进化故事

在代码大模型训练陷入‘数据海战术’困境的2024年,南京航空航天大学的研究团队带来了突破性解决方案CodeACT。这套结合‘学霸式精准刷题’CDAS算法与‘俄罗斯方块式打包’Dynamic Pack的技术框架,仅用40%数据就让模型性能提升8.6%,训练速度提升4倍,重新定义了AI训练的效率革命。本文深度解析这场关于‘少即是多’的技术哲学实践如何改变大模型进化范式。