● 最新博客
全部文章 →DeepEval:用 pytest 的姿势评测 AI Agent,六个指标盯住六种失败
DeepEval(18.5k stars)Agent 评测指南:三层评测范围 + 六指标体系,每个指标对应一种失败模式,pytest 风格跑进 CI/CD。
microsoft/ai-agent-evals:把 Agent 评测塞进 CI/CD,改动不达标就别上线
微软官方 GitHub Action:CI/CD 里离线评测 Foundry Agents,六类 evaluator + 统计显著性检验 + 多 agent 对比,评测报告直接进 Actions summary。
Claude Code Action:把 Claude 装进 GitHub,PR 和 Issue 里的全自动工程师
Anthropic 官方 GitHub Action:@claude 提问、审查 PR、修 bug、定时自动化。从安装到配置的完整指南,含 v1.0 新配置与安全要点。
Answerbit:腾讯出的 GEO 平台,你的品牌在 AI 回答里排第几
腾讯企点营销云旗下 Answerbit:天级追踪品牌在 DeepSeek、豆包、元宝、Kimi、千问回答中的提及率与排名。GEO 是什么怎么用。
AgentJev:0.6B 开源决策模型,一次前向 50ms,零 token 解码
AgentJev-0.6B:基于 Qwen3 的开源决策模型,diff/日志进、概率分布出,零解码。含用法与训练类似模型的完整步骤。
MCP Apps 详解:让 MCP 工具在聊天里长出交互界面
MCP Apps 官方规范详解:server 返回交互式 HTML 直接渲染在聊天里。工作原理、沙箱安全模型、适用场景与生态现状。
用 Jev 和 LangGraph 构建生产级 Agent:LangChain 官方教程翻译
LangChain 官方教程:Jev 决策模型 + LangGraph 编排构建生产级 Agent,文档审查示例快 5-6 倍。全文翻译加解读。
微软终于追上了:Work、Code、Managed Agents 全部合并进新 Copilot
微软发布新 Copilot:Home 合并 Chat 与 Cowork、Code 让非开发者也能构建、Autopilot 常驻 Agent 自动干活。三大能力 + 生态拆解。
为什么和为谁构建 Claude 插件:MCP Connector、Skills 与目录发布全指南
Claude 插件是什么:一次添加、全平台使用,打包 MCP Connector、Skills、MCP Apps 与 Commands。官方构建到发布完整指南。
Whiteboard:当 Agent 写代码,人类最缺的是'看懂它干了什么'
Whiteboard:YC W26 开源的软件设计画布。Agent 在画布上画出自己的工作,人类点击图直达代码,AST 语义 diff 看重点变更。
工具执行前先审一刀:LangChain 把 Jev 接入 Agent 中间件,安全护栏不再是闭源 harness 专利
TypeSafe AI 的 System One 模型 Jev 不生成文本只做结构化决策,比 LLM 快 200 倍省 400 倍,被 LangChain 用于工具执行前风险检查。
Jev 能成为更好的 Agent 评估器吗?LangChain 用 LangSmith 做的实测翻译
LangChain 实测:Jev 作为 Agent 评估器,方差比 GPT-5.6 Luna/Terra 和 Claude Sonnet 4.6 低 92-913 倍,成本仅 $0.00035/次。全文翻译。
DHH 做的 Agent 原生 Linux:Omarchy 一年 117 万次下载,凭什么
Rails 作者 DHH 打造的 Agent 原生 Linux:35 秒安装、Agent 修 bug、2GB 内存也能跑。一年 117 万次下载背后的设计哲学。
OpenKnowledge:Notion 遇上 VS Code,一个让 Claude 和 Codex 直接读写知识库的 AI-native Markdown IDE
inkeep 开源 AI-native Markdown IDE OpenKnowledge:真 WYSIWYG、深度集成 Claude/Codex/OpenCode,内置 MCP 与 Skills,Git 自动同步。
如何设计更好的 MCP server:54 个工具模式 + AWS 权衡 + 官方最佳实践
MCP 解决协议层,工具设计才是缺失的层。整合 Arcade 54 模式、AWS 五方法、官方实践:从命名到架构到生产的完整指南。
Agent RSI 火了:RSIAgent 让开源模型免训练超越 GPT-6,凭什么
RSIAgent:免训练多智能体框架,通过广深探索 + 冻结记忆复用让开源模型超越 GPT-6。三智能体机制与 RSI 研究全景拆解。
Google 开源 AX:用 Kubernetes 的思路编排 Agent,登顶 HN 当日热榜
Google 开源 AX(Agentic Orchestrator):声明式、高吞吐的 Agent 编排运行时,K8s 心智模型,HN 当日 648 分。四大原语与架构拆解。
被曝'偷传代码'后,智谱把 ZCode 开源了:GLM-5.3 官方 Harness 全解析
ZCode 被指登录后静默上传整个 git 仓库,智谱随后开源并披露全部传输行为。GLM-5.3 官方 Harness 功能全解析与选型建议。
Agent 上生产,先过这四关:Trace、Eval、Guardrail、Token 用量
企业 Agent 上生产的四个硬标准:Trace 全链路可观测、Eval 回归评测、Guardrail 安全护栏、Token 用量治理。缺一个都别上线。
Orca:一个桌面 App 同时跑五个 AI 编程 Agent,各自隔离互不干扰
Orca:7.4万星的 AI 编排器。一个桌面 App 并行跑 Claude Code、Codex 等多个 Agent,各自独立 worktree,手机也能远程监控和指挥。
LLM 做决策又慢又贵?System One 模型 JEV、kev、laya 直接算概率
System One 决策模型 JEV:不生成文字、直接输出类型化概率,70ms 出结果。kev 与 laya 开源复刻拆解对比。
微软 Ontology Playground:当 AI Agent 需要一套共享世界观,本体就是那块语义骨架
微软开源 Ontology Playground:纯静态零后端,可视化设计本体、导出 RDF/XML、9 门课程,给企业 AI Agent 建共享语义骨架。
Opik:Comet 开源的 LLM 可观测性与评测平台,2.2 万星,Agent 追踪 + 评测 + 优化一体
Comet 开源的 LLM 观测与评测平台:Agent 追踪、LLM 评测、Prompt 管理、生产监控,Agent Optimizer 自动优化。
📢 广告位招租
通过公众号「AI人工智能时代」留言联系作者
关注公众号入群聊