分析评测 “模型评测”到底是在评什么? 当两套评测指标给出相反结论,模型究竟有没有变好?本文从一次多模态评测实战出发,拆解目标定义、数据供给、评测诊断到版本决策的完整闭环,揭示评测的真正难点不是得分,而是证明分数为何可信。 沐枫 多模态数据质量案例分析
AI,个人随笔 叕进化了:大厂AI评测PM带你一文看懂最新AI工程概念Graph Engineering 当AI从回答问题转向替用户做事,评测逻辑正在被彻底颠覆。Graph Engineering的提出,直指Agent产品从Demo到稳定上线的核心痛点:如何让一堆不稳定的智能节点在系统中可靠协作?本文从评测工程师和产品PM的双重视角,拆解这一新概念背后的真实挑战。 苏墨水儿 AgentAI产品Graph Engineering
分析评测 我们让 Kimi K3、Qwen 3.8-Max 和 GLM 5.2 共同接管了一座屎山 中国大模型三强激战:GLM-5.2、K3、Qwen3.8-Max同台改造真实网站,从屎山代码到前端动效,谁在实战中更胜一筹?本文通过六轮硬核测试,揭晓三款模型在项目理解、代码执行和审美判断上的真实差距。 硅星人Pro GLM-5.2Kimi K3Qwen3.8-Max
个人随笔 AI 产品经理真正缺的不是新概念,而是可验证的交付闭环 AI产品正从概念狂欢走向落地攻坚,产品经理面临的核心挑战已不再是「要不要接AI」,而是如何构建可验证的交付闭环。本文深度剖析Agent可靠性、RAG工程化、模型选型等7大实战命题,揭示从能力展示到流程落地的关键跨越点,为AI产品经理提供从需求验证到风险控制的完整方法论框架。 钟文峰 AgentAI产品RAG
职场攻略 做过 AI 训练师的人,转 AI 产品经理有什么优势? 从AI训练师到AI产品经理的转型之路,远比想象中更具优势。那些与模型真实能力边界、数据质量较量、badcase分析打交道的经验,恰恰是AI产品最需要的底层能力。本文通过实战案例,揭示AI训练师转型的五大独特优势与必须补齐的短板,为跨界者提供清晰的成长路径。 溪居即事 AI产品经理AI训练师badcase分析
AI,个人随笔 RAG 平台 V2:切换智普大模型、补全企业级能力,一次真实升级的全过程 从原型到生产级,RAG系统升级背后的技术抉择与实战陷阱。当国产大模型GLM-4.5-Air替代通义千问,2048维向量替代1024维,开发者需要直面的不仅是性能提升——SDK兼容性陷阱、企业级能力补全、零向量静默失败等5大典型坑位正等待填平。本文将揭秘从裸API到全功能平台的完整升级路径,特别聚焦Embedding模型切换时那些比报错更危险的「正常假象」。 天涯轩 AI工程化GLM-4.5-AirRAG
AI 人工评测 MiMo 五款模型:面向 RAG 选型的能力边界摸底 在RAG系统的选型过程中,自动化benchmark难以揭示模型面对检索片段时能否克制「自由发挥」的冲动。通过对MiMo系列五款模型的25条case盲测,本文揭示了各模型在事实准确性、指令遵循等RAG核心维度的真实表现,以及三类典型失分案例背后的风险点,为技术选型提供关键参考。 阐述你的梦 AI应用MiMoRAG
AI Nano Banana 2 全网最全攻略 Google的Nano Banana系列图像模型迎来重磅升级,Nano Banana 2以闪电般的速度和超高性价比刷新文生图体验。这款代号gemini-3.1-flash-image-preview的模型支持4K分辨率、极端宽高比和多轮对话式编辑,更拥有实时搜索、多图融合等独门绝技。本文将全面解析模型特性、使用技巧与API调用方案,助你在创作效率与质量间找到完美平衡点。 小普 AI绘图Geminigoogle
AI,个人随笔 模型评测“测什么”才不跑偏?三类评测一把捋清! 模型评测中最危险的陷阱不是缺乏测试,而是测试泛滥却无法推动决策。本文将揭秘一套实战验证的分类评测体系:专项能力、功能模块、性能指标三大航道,教你如何将评测从散点检查升级为精准决策工具。从模型选型到系统上线,每个阶段都有对应的评测策略,确保每一次测试都能转化为明确的行动指南。 青蓝色的海 AgentAI产品RAG
AI,个人随笔 别再凭感觉选模型:一篇讲清“大模型评测”到底评什么 模型评测绝非纸上谈兵的学术游戏,而是决定AI产品生死的关键动作。本文撕开评测的技术表象,直击产品经理最关心的核心问题——如何在训练期避开致命陷阱?上线后又该紧盯哪些真实风险?用客服系统的鲜活案例,告诉你如何把抽象指标转化为可执行的决策依据。 青蓝色的海 AI产品大模型案例分析
AI 模型评测怎么做?一篇文章看懂 一次标准流程的测评能够辅助大家更好的对模型进行深入了解。本文作者分享了自己对大模型进行测评的整个过程,其中有不少可以借鉴的点,供大家参考。 思敏 产品分析大模型模型评测