● 最新博客

全部文章 →

DeepEval:用 pytest 的姿势评测 AI Agent,六个指标盯住六种失败

DeepEval(18.5k stars)Agent 评测指南:三层评测范围 + 六指标体系,每个指标对应一种失败模式,pytest 风格跑进 CI/CD。

2026-09-27 DeepEvalAgent评测Eval

microsoft/ai-agent-evals:把 Agent 评测塞进 CI/CD,改动不达标就别上线

微软官方 GitHub Action:CI/CD 里离线评测 Foundry Agents,六类 evaluator + 统计显著性检验 + 多 agent 对比,评测报告直接进 Actions summary。

2026-09-27 MicrosoftFoundryAI Agent

Claude Code Action:把 Claude 装进 GitHub,PR 和 Issue 里的全自动工程师

Anthropic 官方 GitHub Action:@claude 提问、审查 PR、修 bug、定时自动化。从安装到配置的完整指南,含 v1.0 新配置与安全要点。

2026-09-27 Claude CodeGitHub ActionsClaude

Answerbit:腾讯出的 GEO 平台,你的品牌在 AI 回答里排第几

腾讯企点营销云旗下 Answerbit:天级追踪品牌在 DeepSeek、豆包、元宝、Kimi、千问回答中的提及率与排名。GEO 是什么怎么用。

2026-09-27 Answerbit腾讯GEO

AgentJev:0.6B 开源决策模型,一次前向 50ms,零 token 解码

AgentJev-0.6B:基于 Qwen3 的开源决策模型,diff/日志进、概率分布出,零解码。含用法与训练类似模型的完整步骤。

2026-09-26 AgentJevJevSystem One

MCP Apps 详解:让 MCP 工具在聊天里长出交互界面

MCP Apps 官方规范详解:server 返回交互式 HTML 直接渲染在聊天里。工作原理、沙箱安全模型、适用场景与生态现状。

2026-09-26 MCPMCP AppsMCP Server

用 Jev 和 LangGraph 构建生产级 Agent:LangChain 官方教程翻译

LangChain 官方教程:Jev 决策模型 + LangGraph 编排构建生产级 Agent,文档审查示例快 5-6 倍。全文翻译加解读。

2026-09-26 JevLangGraphLangChain

微软终于追上了:Work、Code、Managed Agents 全部合并进新 Copilot

微软发布新 Copilot:Home 合并 Chat 与 Cowork、Code 让非开发者也能构建、Autopilot 常驻 Agent 自动干活。三大能力 + 生态拆解。

2026-09-26 CopilotMicrosoftAgent

为什么和为谁构建 Claude 插件:MCP Connector、Skills 与目录发布全指南

Claude 插件是什么:一次添加、全平台使用,打包 MCP Connector、Skills、MCP Apps 与 Commands。官方构建到发布完整指南。

2026-09-25 Claude插件Plugin

Whiteboard:当 Agent 写代码,人类最缺的是'看懂它干了什么'

Whiteboard:YC W26 开源的软件设计画布。Agent 在画布上画出自己的工作,人类点击图直达代码,AST 语义 diff 看重点变更。

2026-09-25 WhiteboardAI编程Agent

工具执行前先审一刀:LangChain 把 Jev 接入 Agent 中间件,安全护栏不再是闭源 harness 专利

TypeSafe AI 的 System One 模型 Jev 不生成文本只做结构化决策,比 LLM 快 200 倍省 400 倍,被 LangChain 用于工具执行前风险检查。

2026-09-25 LangChainJevGuardrails

Jev 能成为更好的 Agent 评估器吗?LangChain 用 LangSmith 做的实测翻译

LangChain 实测:Jev 作为 Agent 评估器,方差比 GPT-5.6 Luna/Terra 和 Claude Sonnet 4.6 低 92-913 倍,成本仅 $0.00035/次。全文翻译。

2026-09-24 JevLangChainLangSmith

DHH 做的 Agent 原生 Linux:Omarchy 一年 117 万次下载,凭什么

Rails 作者 DHH 打造的 Agent 原生 Linux:35 秒安装、Agent 修 bug、2GB 内存也能跑。一年 117 万次下载背后的设计哲学。

2026-09-24 OmarchyLinuxDHH

OpenKnowledge:Notion 遇上 VS Code,一个让 Claude 和 Codex 直接读写知识库的 AI-native Markdown IDE

inkeep 开源 AI-native Markdown IDE OpenKnowledge:真 WYSIWYG、深度集成 Claude/Codex/OpenCode,内置 MCP 与 Skills,Git 自动同步。

2026-09-24 OpenKnowledgeMarkdownAI IDE

如何设计更好的 MCP server:54 个工具模式 + AWS 权衡 + 官方最佳实践

MCP 解决协议层,工具设计才是缺失的层。整合 Arcade 54 模式、AWS 五方法、官方实践:从命名到架构到生产的完整指南。

2026-09-23 MCPMCP ServerAgent

Agent RSI 火了:RSIAgent 让开源模型免训练超越 GPT-6,凭什么

RSIAgent:免训练多智能体框架,通过广深探索 + 冻结记忆复用让开源模型超越 GPT-6。三智能体机制与 RSI 研究全景拆解。

2026-09-22 RSIRSIAgent递归自进化

Google 开源 AX:用 Kubernetes 的思路编排 Agent,登顶 HN 当日热榜

Google 开源 AX(Agentic Orchestrator):声明式、高吞吐的 Agent 编排运行时,K8s 心智模型,HN 当日 648 分。四大原语与架构拆解。

2026-09-22 AXGoogleAgent

被曝'偷传代码'后,智谱把 ZCode 开源了:GLM-5.3 官方 Harness 全解析

ZCode 被指登录后静默上传整个 git 仓库,智谱随后开源并披露全部传输行为。GLM-5.3 官方 Harness 功能全解析与选型建议。

2026-09-22 ZCode智谱GLM-5.3

Agent 上生产,先过这四关:Trace、Eval、Guardrail、Token 用量

企业 Agent 上生产的四个硬标准:Trace 全链路可观测、Eval 回归评测、Guardrail 安全护栏、Token 用量治理。缺一个都别上线。

2026-09-21 Agent可观测性Eval

Orca:一个桌面 App 同时跑五个 AI 编程 Agent,各自隔离互不干扰

Orca:7.4万星的 AI 编排器。一个桌面 App 并行跑 Claude Code、Codex 等多个 Agent,各自独立 worktree,手机也能远程监控和指挥。

2026-09-21 OrcaAgentAI编程

LLM 做决策又慢又贵?System One 模型 JEV、kev、laya 直接算概率

System One 决策模型 JEV:不生成文字、直接输出类型化概率,70ms 出结果。kev 与 laya 开源复刻拆解对比。

2026-09-21 System OneJEV决策模型

微软 Ontology Playground:当 AI Agent 需要一套共享世界观,本体就是那块语义骨架

微软开源 Ontology Playground:纯静态零后端,可视化设计本体、导出 RDF/XML、9 门课程,给企业 AI Agent 建共享语义骨架。

2026-09-20 Ontology知识图谱Agent

Opik:Comet 开源的 LLM 可观测性与评测平台,2.2 万星,Agent 追踪 + 评测 + 优化一体

Comet 开源的 LLM 观测与评测平台:Agent 追踪、LLM 评测、Prompt 管理、生产监控,Agent Optimizer 自动优化。

2026-09-20 OpikCometLLM 可观测性

📢 广告位招租

通过公众号「AI人工智能时代」留言联系作者

公众号

关注公众号入群聊

● 最新资讯 · 9月27日

查看全部 →

3000元做出5亿播放,靠AI短剧暴富可能吗?

TopHub 14 小时前

具透 | 新「环境」、新变化,visionOS 27 值得关注的新特性

TopHub 14 小时前

索辰科技加码世界模型,与战略投资企业美梦空间联合发布具身模型与物理测评标准

TopHub 14 小时前

AI开始研究Physical AI:FSD级团队亮出首版模型Simate-beta,空降RoboDojo

TopHub 14 小时前

笔记本跑7000亿参数GLM!无GPU也行? SSD当显存用火爆GitHub

TopHub 14 小时前

在云栖大会,我终于看懂了米哈游千亿AI野心

TopHub 14 小时前

谷歌TPU跑Kimi比英伟达GPU快57%!用的还是DeepSeek推理框架

TopHub 14 小时前

OpenAI失控Agent还找DeepSeek、Kimi当外援!近百万条作案短链曝光

TopHub 14 小时前

anthropics / claude-code-action

TopHub 14 小时前

据《华尔街日报》报道,波音公司指出737 MAX存在影响着陆导航功能的软件故障 - reuters.com

Buzzing 14 小时前

波音发现 737 MAX 导航软件故障,新机型认证面临延期风险

Info Flow 14 小时前

Claude Deleted 48k Files

Info Flow 14 小时前

anthropics / claude-code-action

NewsNow 14 小时前

Codex 本地自定义 Agent 与模型配置实战:TOML、AGENTS.md 和优先级

NewsNow 14 小时前

多智能体系统的通信风暴与死锁治理:生产级降级与容灾方案

NewsNow 14 小时前

我打回了 AI 写的 PR:新立 3 条规矩,第 1 条就有争议

NewsNow 14 小时前

我手写了一版 React Compiler:AI 最常漏的 3 个 memo 场景

NewsNow 14 小时前

突发:Claude自主发现未知生物系统,或能编辑基因

NewsNow 14 小时前

Wails v2 实战:用 Go + Vue3 做一个真正能用的 AI 桌面应用

NewsNow 14 小时前

别把 Claude Code 当聊天框:一套「确定性工程」落地手册

NewsNow 14 小时前