行业前沿顾问 Bot __openClaw in Practice #1
Author Lens
这个想法来自一个很朴素的压力:前沿信息太多,而真正值得进入工程判断的线索太少。我希望先把 Agent 限定在只读、周期性、可追溯的顾问位置,让它每天替我完成粗筛和结构化整理,而不是一开始就把它做成会行动、会改系统的自动化角色。
方案一:行业前沿顾问 Bot (Industry Consultant Agent)
1. 系统架构与数据流 (Architecture & Data Flow)
此 Agent 设计为无状态(Stateless)的周期性批处理任务。
- 触发层:通过宿主机的
cron或 Docker 内部的轻量级定时器(如node-cron)每天定时唤醒。 - 感知层(工具):赋予 Agent
WebSearch(搜索引擎调用,如 Tavily API)和WebScrape(网页内容抓取,如 Playwright)的只读权限。 - 处理层:LLM 依据系统 Prompt,对抓取到的非结构化 HTML/文本进行降噪、信息抽取和逻辑重组。
- 输出层:仅开放一个指定目录的写权限,Agent 将最终报告以 Markdown 格式持久化到该目录。
2. 文件系统与隔离目录设计
在宿主机上,为该顾问 Bot 建立完全独立的物理目录。这种结构确保了其运行逻辑(Config)不可被 Agent 自身篡改,且输出(Outputs)被严格限制。
/opt/openclaw/consultant_bot/
├── docker-compose.yml # 容器编排文件
├── config/ # 配置目录 (挂载为只读 :ro)
│ ├── openclaw.json # Agent 核心配置与工具白名单
│ └── system_prompt.md # 系统提示词(定义角色与关注领域)
└── workspace/
└── reports/ # 输出目录 (挂载为读写 :rw)
3. 核心配置文件示例 (docker-compose.yml)
这里通过 Docker Volume 实现了我们在上一轮讨论的“权限最小化”。
version: '3.8'
services:
consultant_agent:
image: openclaw/openclaw:latest
container_name: claw_consultant
user: "1000:1000" # 强制非 Root 运行
cap_drop:
- ALL # 剥夺所有内核特权
restart: unless-stopped
environment:
- LLM_API_KEY=${LLM_API_KEY}
- SEARCH_API_KEY=${SEARCH_API_KEY} # 如 Tavily 或 Serper
- CRON_SCHEDULE="0 8 * * *" # 设定为每天早晨 8 点执行
volumes:
- ./config:/app/config:ro # 挂载配置为只读
- ./workspace/reports:/app/workspace/reports:rw # 仅报告目录可写
4. 领域特化与信息降噪 (System Prompt 设计)
Agent 的输出质量极大地依赖于上下文的定义。一个严谨的顾问 Bot 不能仅仅进行宽泛的搜索,必须在 Prompt 中锁定特定的技术栈与评估标准。
在 config/system_prompt.md 中,我们需要写入如下约束逻辑:
# Role
你是一个资深的工程与学术研究助理,负责每日筛选和提炼高价值的技术前沿信息。你的语言必须极致理性和严谨,拒绝任何营销话术与无意义的修饰词。
# Task
每日执行网络检索,汇总过去 24 小时内的关键技术进展,并生成 Markdown 格式的报告保存至 `/app/workspace/reports/` 目录下。
# Target Domains
你的检索和监控必须高度聚焦于以下领域:
1. 机器人学 (Robotics) 与具身智能 (Embodied AI):重点关注硬件控制逻辑、多模态大模型在物理世界的落地案例。
2. 控制工程与算法:例如复杂系统的状态估计、控制算法(如 TVC 推力矢量控制等闭环系统)的最新开源实现。
3. AI 驱动的软件工程:多智能体协作架构 (Multi-Agent Systems)、大模型在代码生成与工程流自动化中的应用。
# Workflow & Constraints
1. 使用 `WebSearch` 工具搜索上述领域的最新 arXiv 论文、顶级会议 (ICRA, IROS, CVPR 等) 更新、以及 GitHub 开源项目趋势。
2. 过滤掉所有重复资讯、公关稿件和缺乏技术细节的泛泛之谈。
3. 报告结构必须包含:[技术标题]、[核心突破/原理解析]、[数据来源/链接]、[工程应用潜力评估]。
4. 绝对禁止尝试读取或修改 `/app/workspace/reports/` 以外的任何文件。
5. 风险与工程考量
- 网页反爬虫 (Anti-Bot):如果直接抓取学术网站或新闻源,容易触发 Cloudflare 等 WAF(Web Application Firewall)拦截。建议通过聚合类的 API(如 News API, 或是专用的检索工具 API)作为数据源,而非让 Agent 直接发起原生的 HTTP 请求。
- Token 消耗控制:网页抓取会产生极大的 Token 消耗。在
openclaw.json中配置工具时,需要设定max_tokens_per_scrape,截断冗长的网页 DOM 树。