AI,个人随笔 说一个反常识的真相,Agent如今在真实工作场景的成功率依然很低。 真实工作场景下,大模型的表现远不如Coding领域亮眼。本文以阿里国际站开源的RealReplicaBench电商评测集为例,揭示模型在供应商采购、物流规划等真实任务中通过率普遍不足50%的现状,并对比Coding评测的差距,引发对AI实际落地能力的思考。 数字生命卡兹克 AgentAI应用大模型
个人随笔 Anthropic 第一个技术型 PM 最新访谈:现在真正管用的东西叫 evals AI产品经理的底层方法论正在被颠覆。Anthropic的研究PM提出'评测集是新的PRD',在模型能力断层式跃迁的时代,产品经理的核心技能从撰写文档转向定义评测标准,判断力成为最稀缺的资源。本文揭示了这一转变背后的实践与思考。 深思圈 AnthropicClaude经验总结
AI,个人随笔 Agent的边界,是用case划出来的 入职第四天,这位AI产品新人发现,Agent产品经理的第一道工序不是写PRD,而是给AI写标准答案。通过亲手设计评测集、跑竞品流程,他意识到评测集就是Agent PRD的另一种写法,而“假装成功”的bug比报错更危险。本文记录了一个高敏感型产品经理如何用感性体验定义AI产品边界。 Alex的荒诞产品观 Agent产品经理AI产品竞品调研
用户研究 为什么评测集分数和用户口碑,常常对不上? 从客服机器人到AI写作助手,评测集的高分与用户真实体验的割裂成为产品经理的集体困境。本文通过3年实战案例,揭示评测集为何成为'温室成绩',拆解用户表达、多轮对话、分布漂移等真实场景与评测设计的根本冲突,并给出从日志反构评测集、badcase倒灌等5个实用解法,带你重新思考AI产品效果评估的底层逻辑。 溪居即事 AI产品badcase分析产品迭代
个人随笔 90% 的 AI产品经理都在做错竞品分析(包括 4 周前的我) 当传统竞品分析遇上AI产品,三件套工具集体失灵!一位产品经理通过4周实战踩坑,揭示了SWOT、功能矩阵和六层架构在AI时代的致命缺陷——它们无法量化内容生成质量这个核心差异点。本文完整呈现从认知崩塌到重建的历程,提供3个全新分析框架、一套人机协作分工表,以及避免被反问倒的关键判断法则,为AI时代的产品经理重新定义竞品分析的本质。 浩子AIPM AGI分级AI竞品分析内容生成质量