Geek头条(2026-08-09)

  • A self-improving RLM agent for coding workflows and long-running autonomous tasks.

    Prime Intellect

    1. Prime Agent: A Self-Improving RLM Agent

    DocumentationVerifiersPRIME-RLpi-mono

    Prime Agent is an open-source coding and research agent for general and long-running work. It is designed around two core abstractions:

    • The Recursive Language Model (RLM) treats context as variables (prompt-as-a-variable) and tools like recursive subagents as function calls (programmatic tool /sub-agent calling) inside a persistent REPL.

    • The Continual Harness stores supplemental prompts, memories, skill descriptions, and reusable subagent specifications as durable state that Prime Agent can refine through small, evidence-backed updates, local to the session by default.

    Prime Ag…

    2026-08-09 00:18
  • addyosmani/agent-skills

    随着AI编码工具的广泛应用,其输出质量不稳定、缺乏生产级工程规范的问题逐渐凸显,多数AI生成代码难以直接满足生产级软件开发的质量要求。近日,技术开发者Addy Osmani发布agent-skills项目,这是一套专为AI编码智能体打造的生产级工程技能套件。 该套件将资深工程师构建软件时遵循的工作流、质量门禁与最佳实践进行标准化封装,确保AI智能体在开发全周期都能一致执行规范要求。其覆盖从想法到上线的完整开发链路,划分为需求定义(含需求细化、PRD输出)、项目规划、代码构建、测试验证、QA评审、上线发布六大阶段,配套8个斜杠命令,用户输入对应指令即可自动激活对应阶段的工程技能,无需额外复杂配置。 这一方案可有效弥补当前AI编码工具的工程能力短板,降低人工评审与代码返工成本,推动AI编码智能体从“辅助生成片段代码”向“参与全流程生产级开发”升级,也为软件工程的智能化落地提供了标准化参考框架。

    2026-08-09 00:18
  • cloudflare/computer

    Give your agent a computer 👾

    1. Cloudflare Computer

    Cloudflare Computer is a virtual filesystem that lives inside a Durable Object. The Durable Object holds the authoritative state in SQLite and exposes one pluggable execution surface through workspace.runtime. Three backends ship today:

    • Container projects the SQLite state into a sandbox container as a real FUSE mount. A sandbox-side daemon (computerd) mounts the state as a filesystem and syncs changes back over a capnweb RPC channel. Full Linux userland, real binaries, real network.

    • Isolate shell runs just-bash in a Dynamic Worker. It reaches the authoritative Workspace over Workers RPC, so there is no second store or sync round trip.

    • Isolate JavaScript runs an ECMAScript module in a fresh Dynamic Worker with structured input/results, durable relative imports, configured libraries, Workspace-backed node:fs/promises, and trusted ws:git and ws:artifacts modules.

    A Workspace may register multiple backends under stable IDs. workspace.runtime.exec(source, { backend }) is the single execution entry point; the selected backend defines whether source is a shell command or an ECMAScript module. Backends connect lazily on first use.

    Workspace can also be constructed without a backend at all, giving callers the filesystem on its own.

    Important

    PREVIEW ONLY This package is provided as a preview for feedback only. API…

    2026-08-09 00:18
  • mattpocock/skills

    知名开发者马特·波科克(Matt Pocock)近日推出面向真实工程场景的AI Agent技能库“skills”,所有技能均来自其日常开发使用的.agents目录,主打实用工程导向,而非流于表面的“氛围编程(vibe coding)”。

    当前真实应用开发难度颇高,GSD、BMAD、Spec-Kit等流程化开发方案虽试图通过全流程管控提升效率,但往往会剥夺开发者的控制权,且流程中产生的问题难以定位修复。这款技能库基于数十年工程经验打造,具备轻量化、易适配、可组合的核心特点,且兼容所有大语言模型,开发者可自由调整、定制技能,使其适配自身工作流。

    技能库提供两种安装模式,适配不同使用理念:一是通过Claude Code插件安装,获取托管式只读技能包,会随作者的更新自动同步,适合希望直接使用官方版本的开发者;二是通过skills.sh将可编辑的技能文件复制到本地项目,支持开发者深度修改、二次创作,打造专属Agent技能集。目前已有约6万名开发者订阅波科克的通讯以跟进更新,该工具也为工程师提供了更灵活可控的AI辅助开发选项。

    2026-08-09 00:18
  • obra/superpowers

    随着AI编码智能体在软件开发领域的应用持续渗透,智能体未明确需求便直接编码、偏离实际开发目标的痛点逐渐凸显,行业亟需标准化的能力调用框架与工作流程规范。近日开源项目obra/superpowers推出了名为Superpowers的智能体技能框架及软件开发方法论,旨在为各类编码智能体提供完整的开发工作流指引。

    该方法论基于一套可组合的技能体系与初始指令构建,核心是保障编码智能体能够合理调用相关能力、遵循规范流程开展开发工作。目前它已适配十一款主流编码智能体工具,覆盖Claude Code、Cursor、GitHub Copilot CLI、Gemini CLI、Kimi Code、Codex系列工具等产品,开发者可通过项目提供的对应入口快速为自己使用的智能体接入该能力体系。

    根据已披露的工作机制,搭载Superpowers的编码智能体在启动后不会直接着手编写代码,而是会先主动询问用户的真实开发目标,从需求对齐阶段就规避方向偏差。目前该项目的完整工作流程仍在逐步公开中,这套框架有望大幅提升AI编码的需求匹配度与开发效率,为AI辅助软件开发提供更具可操作性的标准化解决方案。

    2026-08-09 00:18
  • 2026 年,软件编程的范式已经彻底变化了。 我们大部分时间已经不是敲键盘写代码,而是一个项目开着十几个 Agent 会话, Claude Code 、Codex 、OpenCode, Pi… 给 Agent 描述编程意图, 编排他们执行这些意图。传统为手写代码进行优化的 IDE ,其布局功能已经不再适合 AI 编程了,这也是最近很多人在做 ADE ( Agent Development Environment )的原因。

    我最近也开发了一个 ADE ,Termio ,一个原生 Mac 终端 ADE ,内核用 libghostty (和 Ghostty 同款),agent 的 TUI 渲染性能很强, 使用极为流畅。更重要的产品设计围绕 AI 编程进行设计,项目管理和 Session 管理的状态一目了然,文件树和 diff 直接在终端旁边显示,给 Agent 提供 context 十分方便。

    另外也开发了 iOS ,随时随地通过手机进行 AI 编程。比如陪家人下楼散步时把想法告诉 Agent ,让它立即开始执行。等散步回来,Agent 可能已经完成了任务。然后你再坐回电脑前,检查和验收它的工作。

    Termio 应该是当前市面上当前最漂亮的 ADE 终端了,无论客户端还是 iOS 设计都极为漂亮。如果你想要一款漂亮,稳定的 ADE 终端,可以下载试一试 termio.sh

    dark

    2026-08-09 00:18
  • 1.5万星背后:Google首次揭秘Agent Skills是怎么“造”出来的

    在智能体(Agent)技术快速发展的行业背景下,Google Agent Skills开源仓库自上线后便受到技术社区广泛关注,迅速斩获1.5万星标,吸引各产品团队争相贡献,项目扩张势头迅猛。但开放协作的模式在加速项目规模化的同时,也带来了质量参差不齐的潜在风险,如何平衡扩张速度与质量管控,成为这类开源AI项目面临的共同挑战。 本文基于Google Cloud官方博客内容,结合Google首次对外披露的内部实践,完整还原了其保障Agent Skill质量的整套管控机制:通过标准化目录结构实现所有技能资源的统一规范管理,依托CI/CD自动检查对贡献内容进行质量校验,搭建持续评测矩阵对技能表现进行多维度验证,同时推行“Skill Owner”责任制明确每一项技能的质量责任主体。这套成体系的质量管控方案,让Google在Agent Skills项目快速规模化的过程中牢牢守住了质量底线,其成熟的落地经验也为国内开展同类智能体技能项目建设、开源社区运营的团队提供了重要参考。

    2026-08-09 00:18
  • 做中转这事儿,现在回头看是真没啥 Diao 意思。

    近期有中转服务运营者分享了自身运营Tibo中转服务的经历与后续调整计划。最初因Tibo平台频繁重置账户额度,该运营者计划将中转配置从10x升级至20x,认为此举既能压缩成本,又能为用户提供更好的使用体验,因此发起了组团共享中转的“拼车”服务。 但平台后续的政策变动完全超出预期:Tibo不仅不再重置额度,还下调了账户的额度上限。与此同时,参与该服务的拼车用户使用量都极高,每日消耗持续逼近额度上限,导致当前账户额度十分紧张。 针对此前部分用户反馈的“中转速度慢”问题,该运营者并不认同,他表示只要搭建方案合理,中转速度完全可以满足使用需求,自己的服务速度就足够快,当前真正的核心问题是用户使用消耗过高,额度根本无法支撑长期运营。 该运营者坦言这番折腾下来,觉得运营这类共享中转服务没有太大意义,目前计划先撑完本月的服务,下个月就将中转转为自用,不再对外提供。这一案例也折射出依赖第三方平台额度的共享中转服务稳定性极差,极易受平台政策变动影响,参与此类服务的用户也随时可能面临服务中断的问题。

    2026-08-09 00:18
  • 作为国内头部互联网科技企业字节跳动的创始人,张一鸣的个人动向始终是科技圈、创投圈的关注焦点。自2021年他卸任字节跳动CEO、淡出公司日常运营管理后,外界对其精力投向的猜测从未停止,不少行业观察者认为,这位曾主导打造今日头条、抖音等现象级产品的创业者,其重点关注的方向往往代表着科技领域的潜在新风口。 近期,“张一鸣将50%的时间投入Seed相关方向”的消息引发行业广泛热议,也让“张一鸣的时间和精力究竟放在哪里”成为公众讨论的核心话题。目前外界尚未获取关于Seed项目定位的官方公开信息,仅从张一鸣的投入力度来看,该方向大概率属于字节跳动布局的前沿科技类长期赛道,而非已进入稳定运营阶段的成熟业务线。 作为曾多次精准踩中互联网产品与技术风口的行业领军者,张一鸣的精力分配一直被视作行业风向标,其重点投入的方向不仅会直接影响字节跳动的长期战略布局,也可能带动相关科技赛道的创业、投资热度,后续Seed项目的相关信息披露,将成为行业观察的重要参考。

    2026-08-09 00:18
  • 近年互联网行业就业市场中,产品经理岗位竞争热度居高不下,据主流招聘平台发布的互联网职场调研显示,月薪18-25K档位的中阶产品岗是跳槽人群的核心诉求区间,其中20K月薪更是多数拥有1-3年产品经验从业者的跳槽目标档位。但由于该档位候选人供给充足,企业招聘时对候选人的业务匹配度、实操能力要求不断提升,不少求职者因缺乏针对性准备,难以通过简历筛选和业务面试,无法拿到预期薪资的offer。 本次推出的产品经理求职攻略,专门针对有跳槽需求、目标为月薪20K产品经理岗位的求职者,明确了拿下该档位offer所需达到的求职准备标准,为从业者提供清晰的求职方向指引。 这份攻略能够帮助目标求职者理清求职准备的核心逻辑,避免盲目海投、无效准备的问题,有效提升求职效率与心仪offer的获取概率,同时也为行业内中阶产品经理岗位的能力评估提供了市场化的参考维度。

    2026-08-09 00:18
  • Go 核心团队公开新提案流程设计:加权投票、多轨评审,能拯救积压的近千个提案吗?

    作为谷歌主导的开源编程语言,Go语言的功能迭代与生态演进高度依赖社区提案机制,但近年来提案积压已成为困扰项目与社区的长期难题。目前Go社区待评审提案近千份,积压周期长达两年,且新增提案数量仍以每年23%的速度增长,原有评审流程的效率短板愈发凸显。 近期,Go核心团队技术负责人Austin Clements正式提出一套全新提案流程方案,试图系统性破解这一老大难问题。新流程核心包含三大机制:一是正式化Triage(提案分诊)小组,负责提案的初步筛选、分类与优先级判定,梳理提案入口秩序;二是引入加权社区投票机制,为不同社区参与者设置差异化投票权重,兼顾广泛民意与决策专业性;三是推行多轨道并行评审模式,针对不同类型、复杂度的提案匹配对应评审路径,提升整体评审效率。 这套方案围绕“分层提效、兼顾共识”的设计逻辑展开,但也在社区引发争议,焦点集中在加权投票的公平性、多轨评审的划分标准、Triage小组的权责边界等方面。新流程若落地,有望显著缓解Go社区的提案积压问题,其治理思路也可为其他开源项目的提案机制优化提供参考,不过实际效果仍有待实践检验。

    2026-08-09 00:18
  • 近期国内AI企业MiniMax推出的H3大模型凭借性能表现引发行业高度关注,同时围绕该模型的技术实力、开源规划、多模态布局等方面也涌现出不少犀利质疑,不少开发者与行业观察者都在等待官方给出明确回应。 面对外界的疑问,MiniMax H3团队并未选择回避,而是主动登陆海外知名科技社区Reddit,以在线互动的形式直面各类质疑,公开回应外界关心的所有核心问题。在此次交流中,团队透露了多项关键规划:2K分辨率相关的模型能力将正式开源,旗下图像生成大模型正处于研发推进中、即将与公众见面;此外针对开发者高度关注的开源协议问题,团队表示也在考虑采用Apache 2.0这一行业通用的宽松开源协议。 这种坦诚直面质疑的沟通方式,既能够快速消解外界对H3模型的诸多疑虑,提升MiniMax的品牌透明度与信任度,其后续的开源与多模态布局若顺利落地,也将为全球AI开发者提供更多优质的技术选项,进一步推动大模型技术的普惠应用,甚至有望带动国内大模型开源生态的发展,促使更多厂商加入开放协作的行业趋势中。

    2026-08-09 00:18
  • 从 GPT-2 到 Kimi K3,大模型技术演进路线展示了 AI 架构如何从“记住一切”,走向“选择性记忆”。KV Cache 解决生成效率问题,Linear Attention 探索更高效的长期记忆,DeltaNet 和 Kimi Linear 则进一步让模型学会更新、遗忘和管理信息。

    2026-08-09 00:18
  • 随着生成式AI技术快速迭代,其在网络安全领域的应用潜力与风险已成为全球安全行业的核心关注方向,高能力前沿AI系统更被视为关键网络能力的“下一个前沿”——这类技术既可为网络防御提供强力支撑,也存在被恶意利用、放大网络攻击危害的潜在风险,因此头部AI企业的模型安全治理进展始终受到行业与监管层面的高度关注。 近期,OpenAI正式对外分享了针对旗下Astra模型的初步网络安全评估结果,同时披露了团队正在推进的一系列强化安全保障与安全管控的举措,这是该公司回应前沿AI网络能力新挑战、完善自身安全治理体系的最新公开动作。 此次公布的初步网络安全评估聚焦Astra模型的网络安全相关风险,将为OpenAI后续优化安全管控策略提供核心依据,而同步推进的安全保障与管控强化工作,将进一步筑牢模型的安全防线,防范其被滥用于恶意网络活动。 OpenAI此次主动公开Astra的网安评估进展与管控规划,既回应了行业与公众对前沿AI网络安全风险的普遍关切,也为全球AI行业开展高能力模型的安全评估与治理提供了参考样本,有望推动行业建立更统一的前沿AI网络安全管控标准,整体降低AI技术被滥用于网络攻击的潜在风险。

    2026-08-09 00:18
  • 一线大厂的Git规范

    近期有开发者咨询可落地的优质Git操作规范,针对这一需求,技术内容创作者整理了一线互联网大厂普遍采用的Git规范体系进行系统性拆解,旨在为开发者提供可参考的标准化方案,更多项目实战内容可在Java突击队网(susan.net.cn/project)获取。 Git规范是大厂研发流程中的核心基础规则,受到高度重视,背后主要有三点核心原因:一是适配大规模协作场景,单个项目常涉及数十至上百名开发者并行开发,缺乏规范会引发分支冲突、代码覆盖、版本混乱等问题,严重拖垮团队效率;二是保障问题可追溯性,规范的提交信息能帮助团队快速定位线上bug的修改主体、时间与具体内容,避免排障时大海捞针;三是支撑自动化研发流程,CI/CD流水线高度依赖Git规范,可实现自动生成更新日志、按分支名触发对应环境部署、按标签自动确定版本号等功能。本质上规范并非用于约束开发者,而是为了降本提效。 分支策略是Git规范的核心框架,当前大厂主流分支模型共三类,其中Git Flow是2010年由Vincent Driessen提出的经典企业级模型,至今仍被广泛应用,可为不同规模的团队提供分支管理参考。

    2026-08-09 00:18
  • 8月主题《人生目标感》,昨晚第1次直播,关于我自己的故事。

    首先,要有自己的人生目标感(7月主题),我的第一个10年,是想成为一个很厉害的人:架构师,研发管理者,是业务负责人。

    这个过程中,抓主要矛盾的底层能力,是如何成为我思维里的一部分的呢?

    第一阶段,想成为优秀的架构师。 此时我:【什么都想要】。

    1. 技术上,想学的太多;
    2. 业务上,内心看不起百度HI的逻辑代码,觉得没有技术含量;
    3. 工作之余,想学习,想做自媒体,想做外包,想搞副业;

    我以为,多想多做=多收获,而实际上:

    1. 根本没想清楚,当下主要矛盾是什么;
    2. 舍不得放弃各种选项;

    第二阶段:想成为优秀的研发管理者。 此时我:【“被迫”聚焦】。

    1. 作为技术委员会主席,资源有限;
    2. 带一线团队,管员工,时间有限;
    3. 带二线团队,管leader,精力有限;

    我开始意识到,事并不是越多越好,而是做好主要的2-3件事。

    第三阶段:想成为优秀的业务负责人。 此时我:【主动规划,抓主要矛盾】

    1. 接手搬家团队,主要矛盾是啥?人,各个方向上要有靠谱的人。
    2. 搬家产品体验,主要矛盾是啥?首先是价格确定性,其次是服务体验。 …
    2026-08-09 00:18
  • 我们正在更新Claude Fable 5的生物安全防护措施以减少误报。在我们的测试中,这一……

    人工智能企业Anthropic近期宣布,将对旗下Claude Fable 5大模型的生物学安全防护机制进行升级,核心目标是降低安全策略的误判率,减少不必要的安全拦截。Anthropic长期认为,AI技术最大的正向影响将体现在生物学与医学领域,因此始终致力于将前沿智能能力安全地交付给尽可能多的研究人员。 据官方披露的内部测试数据,此次更新完成后,Anthropic全产品端的生物学相关请求触发安全兜底机制的比例较此前下降了约85%。安全策略优化后,Fable 5能够响应更广泛的日常健康咨询、基础生物学教育类问题,覆盖更多普通用户的日常需求。 不过,针对病毒学、毒理学、分子设计等被认定为具有“双重用途”风险的请求,Fable 5仍将触发兜底流程,转由更高阶的Opus 5模型处理,因此当前该模型尚无法支持专业生物学研究、药物开发等专业场景。Anthropic表示,未来将通过可信访问路径逐步开放前沿生物学AI能力,填补当前的能力缺口。该公告发布后引发广泛关注,已获得超8900次点赞、176万次浏览。

    2026-08-09 00:18
  • 科技爱好者周刊(第 407 期):国家为什么需要开源软件?

    本文为《科技爱好者周刊》第407期内容,该周刊每周五发布,精选每周值得分享的科技领域内容,项目开源托管于GitHub,面向读者开放投稿通道,还设有“谁在招人”服务用于发布程序员招聘信息,商务合作可通过指定邮箱联系。本期封面图为上海浦江郊野公园的溪边咖啡馆,核心专题围绕“国家为什么需要开源软件”展开探讨。 上月大模型Kimi K3正式发布,其在美国市场引发的反响甚至超过中国。该模型性能虽略逊于美国顶尖大模型,但凭借开源可自主架设的特性,对大型企业具备极强吸引力。 当前美国经济增长几乎完全依赖AI领域的巨额投资,其余行业增长乏力;若大量企业转向自行部署开源模型,美国已投入的海量AI资本将面临无法收回的风险。在此背景下,美国政府公开表态称中国模型存在“违规”行为,正考虑限制开源模型,这一消息引发行业恐慌——历史上从未有国家封锁过开源项目。表态发布两天后,美国多家互联网企业联合发表公开信,主题涉及开放权重模型与美国AI领导相关议题。 该事件凸显了开源软件在全球科技竞争中的关键作用,开源模型的发展正在重塑AI产业格局,也对现有AI监管规则与投资逻辑带来了新的挑战。

    2026-08-09 00:18
  • An interactive tour of Go 1.27

    #​613 — August 7, 2026

    Read the Web Version

    Go Weekly

    An Interactive Tour of Go 1.27 — Anton Zhiyanov made interactive tours for Go 1.22 through 1.26 but decided to stop. Jesús Espino has picked up the baton and tackles Go 1.27’s huge array of features here, from generic methods and the goroutineleak profile to the new uuid package and experimental portable SIMD.

    Jesús Espino

    💡 No, Go 1.27 has not been released yet, but the second release candidate is solid, and the final is expected in the next week or two.

    Harness Engineering: How to Wrangle Your Agents — The models keep changing. The harness is the part you build. Scott Moss (Netflix) shows how: durable execution, sandboxed tool calls, memory systems, and multi-agent handoffs.

    Master.dev sponsor

    A Proposal to Fix Go’s Proposal Backlog — The backlog is growing 23% a year with the median item over two years old. Austin Clements proposes a formal triage group, review tracks, and weighted community emoji voting to decide what gets reviewed next (though not what gets accepted).

    The Go Team

    Going Backward (or Why slices.Backward Looks So Complicate…

    2026-08-09 00:18
  • 在生产环境中运行自动模式

    这篇科技报道聚焦IT运维与软件工程领域的核心实践议题,核心内容围绕“在生产环境中运行自动化模式”展开。当前全球企业数字化转型进入深水区,生产环境作为承载企业核心业务、直接服务终端用户的关键IT环境,其运行稳定性、响应效率直接决定企业的服务质量与市场竞争力。传统生产环境的部署、运维、故障处置多依赖人工操作,不仅难以匹配业务快速迭代的需求,还容易因人为疏忽引发生产故障,造成业务中断、数据损失等严重后果。此前自动化模式多应用于测试、预发布等非生产环境,用于验证功能与流程,较少直接在生产环境中落地。该报道围绕这一技术实践的行业关注方向展开专业呈现,生产环境自动化模式的落地推广,能够大幅降低人工操作占比,提升运维效率与系统可靠性,同时支撑业务的弹性扩缩容与快速迭代,对企业数字化能力的升级具有重要推动意义,也为IT运维领域的技术演进提供了新的发展思路。

    2026-08-09 00:18
大图预览

Feedback