【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 --- (12)--- GRPO
【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 (12) GRPO 目录【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 (12) GRPO0x00 概要0x01 GRPO基础1.1 GRPO 解读PPOGRPOGroup ...
TensorBoard PPO log 解析
接上篇: macos(M4)上跑强化学习 - PyTorch LunarLander-v3 Stable-Baselines3 官方文档参考:https://stable-baselines3.readthedocs.io/en/master/common/logger.html#explanati ...
洛谷 P7912 [CSP-J 2021] 小熊的果篮 题解
[CSP_J 2021]小熊的果篮 题解 1.题目 题目描述 小熊的水果店里摆放着一排 \(n\) 个水果。每个水果只可能是苹果或桔子,从左到右依次用正整数 \(1, 2, \ldots, n\) 编号。连续排在一起的同一种水果称为一个“块”。小熊要把这一排水果挑到若干个果篮里,具体方法是:每次都把 ...
从零实现 DEFLATE 压缩器:纯 C# 移植版如何在 Excel 场景超越 .NET 内置?
LibDeflateCompressor 性能深度分析:纯 C# DEFLATE 压缩器 vs C 原生 vs .NET 内置 ** Acl.Excel 系列文章(共 3 篇)** 序号 文章 重点 ③ Acl.Excel vs MiniExcel 1.45.0:百万行读写实测 端到端性能对决,最多 ...
Zabbix 官方插件市场来了:14 个插件,一键补齐运维短板
作为企业基础设施监控的主流开源方案,Zabbix 凭借稳定、通用、低成本的优势覆盖数万政企机房。在 20 年的发展历程中,Zabbix 服务过成千上万家客户,其能力获得了用户的一致认可。 但也有用户向原厂反馈,Zabbix 的原生功能在可视化、运维报表、资产管控等方面仍有继续优化空间。 好的,用户想 ...
InfluxDB 连续查询中的 RESAMPLE 用法详解
一、什么是 RESAMPLE? 在 InfluxDB 的连续查询(Continuous Query, CQ)中,RESAMPLE 是一个高级配置子句,用于控制 CQ 的执行频率和数据查询时间范围。它解决了数据延迟、数据乱序等实际生产环境中常见的问题。 基本语法 CREATE CONTINUOUS Q ...
下个吉时|我让 AI 给 GitHub 项目算了一个“合并代码的良辰吉时”
“合历”是一款趣味AI Coding实践项目,为GitHub仓库智能推荐代码合并与发布的“良辰吉时”,通过这款趣味实践项目,一篇带你走完AI从零开始写的完整工程实践 ...
我写了个不用上传的浏览器视频压缩工具,顺便记一个坑了我小半天的 bug
起因很土。我经常要把录屏发到 Discord 或者塞进邮件,Discord 免费版限 10MB,邮箱附件常见 25MB,而一段两三分钟的 1080p 录屏动不动几十兆。网上的在线压缩工具能用,但每次都得先把视频传到人家服务器,压完再下回来。慢是一回事,更别扭的是,我不太想把公司内部的录屏传到一个不知... ...
从 vibe coding 到 spec coding:Trellis 的实践总结
grill-me、Trellis、Superpowers 到底该用哪个? 现在用 ai 写代码很多时候都是一把梭的,也就是说我只需要给 ai 一个要求指令,剩下的就交给 ai了,现在模型能力确实越来越强,有时候我甚至可以不用 superpowers 这种工作流插件都可以做到很规范。所以这种 vibe ...
spec-kit实战:我用SDD方法论解决AI编码幻觉问题
不知道你有没有遇到过哲宏场景:使用 Cursor 写用户权限模块,vibe coding了3小时,代码跑起来才发现AI把角色继承的逻辑搞反了——我明明说过要RBAC0,它写成了RBAC1的继承方向。改到第5版的时候,AI已经忘了我最开始提的「不支持动态角色」的约束。 这种破事我起码遇到过十次。直到上 ...
Redis主从切换后,旧主恢复竟触发全量同步?——我猜错了,原因比想象中更严谨
上周做Redis故障演练,主节点A宕机,从节点B升主。A恢复后,我本以为它会走增量同步——毕竟B的缓冲区足够大,A的偏移量也在范围内。但日志显示:全量同步。这是怎么回事? 如果你也遇到过类似的现象,或者单纯好奇Redis主从复制在故障转移后到底怎么决策的——这篇文章就是为你写的。我们不背八股文,而是 ...
Claude Code 最强Skills路由器:/ask-matt 完全上手指南(入门篇)
很多人兴致勃勃地装了 Matt Pocock 的 Skills 之后,大概率只用过其中两三个。剩下的一直躺在列表里——不是没用,是你不知道什么时候用、按什么顺序用、用完之后下一步接什么。 ...
高可用之路·观测篇-指标失明
高可用之路·观测篇-指标失明 前言 紧接上篇<<高可用之路-闲聊监控指标的局限>>。上篇说到,指标只是事实的投影,由于代价的存在它无法无限的逼近真实。因此,指标自身的局限有时不仅无法帮助我们发现问题,反而可能迷惑甚至误导我们。本文将详细讨论指标局限最常见的一种表现——指标失明,即问题已经发生,指标却 ...
60 路并发出图率从 20% 到 90%:我踩的四个坑
前言 我写了一套串行排队调度模块,上线压测后,8 秒出图率纹丝不动——还是 20%。 这不是一篇"怎么排查出图慢"的技术教程,那种文章 CSDN 上够多了。这篇写的是我在排查过程中犯的四个错:为什么错、错在哪一层、下一次怎么避开。 如果你也在做服务端性能优化,大概率会踩到同类坑——不是因为技术不够, ...
sync.Mutex 互斥锁
sync.Mutex 互斥锁 一、为什么需要互斥锁 当多个 goroutine 同时读写同一个变量时,会发生数据竞争(data race)。比如银行账户的例子: var balance int func Deposit(amount int) { balance = balance + amount ...
中国的 Agent 时代,正在从工程能力里长出来
当下 AI 不再只是用来写一小段代码,而是能接需求、拆任务、推进执行,最后交付一个项目。换句话说,它开始更像一个活生生的人。 01 | Agent 不只是大模型 如果把 Agent 写成一个简单公式,可以是: Agent = 大模型 + Harness 大模型像发动机,决定“跑得快不快”。Harne ...
RocketMQ 常见面试题与高频考点:从原理到实战的自我检验
RocketMQ 常见面试题与高频考点:从原理到实战的自我检验 系列第二十篇:生态整合与实战篇(四) 你好,又见面了。 这是 RocketMQ 系列文章的 收官之章,也是一份特别的礼物 —— 面试自查手册。 过去的十九篇文章,我们从“什么是消息队列”一路走到了“生产级规范与最佳实践”,完成了 Roc ...
踩了个大坑!K8s 挂载目录的日志,居然也在吃容器内存?
最近一直收到某个服务pod容器内存超过80%的告警,堆内存加上堆外内存目前看也只有1G左右,但pod内存却达到4G多,查来查去查到active_file对应的logs占用大量内存,目前现状是k8s中springboot服务日志挂载到宿主机/logs目录,/logs目录的所有日志大小有3G,容器内存显 ...
FHQ-Treap详细解析
FHQ-Treap 是一种不带旋的平衡树,和带旋版本一样都是用随机优先级完成平衡。不同的是,FHQ-Treap 是通过分裂和合并来插入和删除,也可以用于文艺平衡树。 ...
写了一个全功能的 RocketMQ .NET 客户端:EventHorizon.RocketMQ
目录前言功能概览它不是官方客户端的替代品快速接入先启动本地测试环境gRPC:通过 Proxy 连接 RocketMQ 5Remoting:通过 NameServer 发现 Broker多集群或多实例发送消息消费消息gRPC 的消费模型PushConsumerclassic Remoting 的消费模 ...


