《凡人修仙传》官方动画
Agent 生产化的最小闭环:浏览器、Skill 与文件如何接起来
从 Claude Platform 的 Computer Use、Browser Use、Skills API 和 Files API 出发,拆解生产 Agent 的输入、方法、执行、交付与隔离边界。
Agent 贡献不该只靠一份说明书:把规则变成合并门禁
从 AutoGPT 的维护实践理解 AGENTS.md、Skill、PR、CI 与人工决策的职责边界,以及如何把 Agent 贡献变成可追溯交付。
一次 DeerFlow 开源贡献:锁住字典之后,任务为什么还是串了
从确定性复现到 PR 合并,复盘 DeerFlow 后台 Subagent 的并发身份冲突,以及外部关联、内部执行和消息重放幂等如何分层。
Agent 不该把审批全交给人:Claude Code 的 Auto mode
Claude Code 将人工审批迁移为独立安全分类器与确定性策略协作,暴露了 Agent 权限系统如何应对审批疲劳。
Agent 失败,可能只是环境没把话说清楚
ALIGN 说明,一句模糊的错误反馈会把接口缺陷伪装成模型能力缺陷。理解 Agent 与环境接口失配,才能让评测分数更可解释。
Agent 越界不是一句提示词能拦住的
OpenAI 与 Anthropic 的安全评测事故说明,提示词描述模型应当相信的世界,Harness 与基础设施才决定它真正能触达的世界。
当模型不再需要手把手:Claude 5 与无状态 MCP 带来的 Agent 工程变化
Claude Code 为新模型删掉了 80% 以上的系统提示词,MCP 也从有状态双向协议转向无状态请求。解释 round-robin、JSON-RPC、SSE 与 MRTR,并讨论 Agent 工程的复杂性究竟去了哪里。
指标变好了,但默认没开:SAGE RAG 的几个工程取舍
把 PostgreSQL 全文检索 + 精确向量 + RRF 接进 SAGE,并在同一协议下比较 FastEmbed、百炼和豆包后,百炼在冻结测试把 Recall@10 从 0.889 提到 1.000。但它仍然默认关闭。记录这次 RAG 工程化里几个由证据而不是技术标签决定的取舍。