<?xml version="1.0" encoding="UTF-8"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>智能体 · AI 简报 · darius.wiki</title><link>https://www.darius.wiki/topics/ai-agents/</link><atom:link href="https://www.darius.wiki/topics/ai-agents/rss.xml" rel="self" type="application/rss+xml"/><description>智能体落地：评测、可靠性、工具调用与成本</description><language>zh-CN</language><lastBuildDate>Sat, 10 Oct 2026 00:00:00 GMT</lastBuildDate><item><title>Google 开源 AQuA：定期抽样生产会话、为线上智能体找问题的质量智能体，32 个会话一次扫描 3.76 美元</title><link>https://www.darius.wiki/daily/2026-10-10/google-aqua-ambient-quality-agent/</link><guid isPermaLink="true">https://www.darius.wiki/daily/2026-10-10/google-aqua-ambient-quality-agent/</guid><pubDate>Sat, 10 Oct 2026 00:00:00 GMT</pubDate><category>工具</category><description>不在请求链路上、只读不改，用另一个智能体给线上智能体做体检。 视角: 我更看重核验那一步：先让模型找问题，再让它对照原始记录剔除误报，这和我坚持只引一手信源是同一个道理。智能面试这类会话型产品可以照搬这个思路，每次发版后抽几十个真实会话做体检，一次几美元，比等用户投诉便宜得多。</description></item><item><title>Hugging Face 展示 ML-Intern：智能体几天内训出 6 个模型，总花费约 103 美元</title><link>https://www.darius.wiki/daily/2026-10-10/hugging-face-ml-intern/</link><guid isPermaLink="true">https://www.darius.wiki/daily/2026-10-10/hugging-face-ml-intern/</guid><pubDate>Sat, 10 Oct 2026 00:00:00 GMT</pubDate><category>工具</category><description>一个先要预算、再跑小测试、最后训练发布的机器学习智能体，已在 HuggingChat 里可用。 视角: 「从 0 预算开始、花钱先问」是所有会动钱的智能体都该抄的设计。对小团队，这意味着训一个专用小模型的门槛降到几美元一次试验；我会拿内容审核、标签分类这类固定任务先试一版，再和直接调大模型比成本。</description></item><item><title>GitHub Copilot 本地沙箱正式可用：限制智能体命令的文件、网络与凭据访问，企业可强制开启</title><link>https://www.darius.wiki/daily/2026-10-08/github-copilot-local-sandboxing/</link><guid isPermaLink="true">https://www.darius.wiki/daily/2026-10-08/github-copilot-local-sandboxing/</guid><pubDate>Thu, 08 Oct 2026 00:00:00 GMT</pubDate><category>工具</category><description>Copilot 在开发者本机执行的工具和命令，现在可以跑在按策略限权的沙箱里，不另收费。 视角: 让编码智能体放手跑，最大的顾虑一直是它在本机能碰到什么。我会先把团队的默认策略定成「只能写当前仓库、禁止读 Git 凭据、联网走白名单」，本地 MCP 服务器也一并纳入；这比事后审查每一条命令省心得多。用其他编码智能体的团队，也该照这个标准检查自己的隔离做法。</description></item><item><title>微软宣布 Windows 智能体容器 MXC 正式可用，NVIDIA RTX Spark 笔记本开放预订：1 PFLOPS FP4、最高 128GB 统一内存</title><link>https://www.darius.wiki/daily/2026-10-08/nvidia-rtx-spark-windows-mxc/</link><guid isPermaLink="true">https://www.darius.wiki/daily/2026-10-08/nvidia-rtx-spark-windows-mxc/</guid><pubDate>Thu, 08 Oct 2026 00:00:00 GMT</pubDate><category>行业</category><description>在微软 Windows AI 与 Surface 发布会上，两家把「智能体在本机常驻运行」从系统层和硬件层一起推了一步。 视角: 和上面 Copilot 本地沙箱用的是同一个 MXC，本机跑智能体的隔离层已经在系统里了。128GB 统一内存能装下百亿级模型，意味着「隐私数据不出机」的需求可以先在单台机器上验证：AI 云盘这类处理私人文件的产品，可以考虑出一个本地推理的版本。但别急着买硬件，先确认你的工作负载在本地模型上的质量够不够。</description></item><item><title>Microsoft 开源 ThinkingBox：507 个业务流程各跑 20 次，按数据库终态给智能体打分</title><link>https://www.darius.wiki/daily/2026-10-05/microsoft-thinkingbox/</link><guid isPermaLink="true">https://www.darius.wiki/daily/2026-10-05/microsoft-thinkingbox/</guid><pubDate>Mon, 05 Oct 2026 00:00:00 GMT</pubDate><category>研究</category><description>智能体说「做完了」不算数，数据库里的记录才算。这一条讲它怎么测、测出了什么，以及「稳定完成」到底多贵。 视角: 单次通过率会骗人。我在智能面试的评分环节也会照这个思路改：同一份答卷重复跑多次、校验落库的结果是否一致，而不是只看模型说了什么。选模型时把「20 次全对率」和「稳定完成成本」放进评估表，比看排行榜有用。</description></item></channel></rss>