跳到正文

#教程/实践

今日 37 条
9月30日周三
  1. 架构师之路AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI时代进程内缓存怎么写spec?《AI时代的架构设计100讲》第8讲

    架构师之路《AI时代的架构设计100讲》第8讲提出,进程内缓存应默认禁止、例外放行,并给出可直接复制的spec模板:模式声明、红线约束、异常与降级、验收标准四部分。原因是AI写代码时爱自作主张加本地Map“优化性能”,必须把默认禁止写进spec。仅三种场景放行:只读数据启动加载、极高峰挡流量、允许一定程度数据不一致。

  2. Recraft(@recraftai)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Recraft 分享写实人像提示词:85mm 镜头棚拍微笑女性

    Recraft 转发并公开了 @Abmankendrick 的一段写实人像提示词,描述一位二十多岁后期、深棕色长卷发的微笑女性,身穿中蓝色圆领卫衣、佩戴金色耳环。提示词指定了中性灰渐变影棚背景、左前方柔和漫射光、浅景深与 85mm 镜头,强调自然肤质与超高细节。

  3. NVIDIA Technical BlogAI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NVIDIA TensorRT Model Connect:以 AI 原生方式构建开源项目的经验

    NVIDIA TensorRT Model Connect 是一个基于 TensorRT、用 C++ 编写的开源 AI 模型参考实现集合。项目以编码智能体为核心设计,采用并行开发、模型族隔离、可回滚改动和 GPU 验证等做法,目标是让 TensorRT 推理栈的性能更易被使用。

  4. Julien Chaumond(@julien_c)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    0xSero 的 DGX Spark 指南已在 Hugging Face 发布

    Julien Chaumond 推荐了 @0xSero 撰写的一份 DGX Spark 指南,该指南已在 Hugging Face 博客上线。原文未披露指南的具体内容、篇幅或技术细节。

  5. Amjad Masad(@amasad)AI 评估 · 39/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    如何设计并构建 harness,以更低成本达到前沿性能

    Michele Catasta 分享了如何设计并构建 harness,以远低于常规的成本达到前沿性能。原文未披露具体模型、参数规模或 benchmark 数据。

  6. NVIDIA AI(@NVIDIAAI)AI 评估 · 33/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    本地 AI:在 DGX Spark 与 Station 上运行 Nemotron | Nemotron Labs

    NVIDIA 发布 Nemotron Labs 内容,介绍如何在 DGX Spark 与 DGX Station 上本地运行 Nemotron 模型。该内容面向本地部署场景,展示 Nemotron 在 NVIDIA 自有硬件上的运行方式。

9月29日周二
  1. 沃垠AIAI 评估 · 64/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    保姆级教程:用Coding模型做视频,附全套元提示词

    作者冷逸演示了用 Coding 模型做视频的完整流程,底层逻辑是让 LLM 用 JavaScript 或 Three.js 写每一帧画面生成 HTML,经无头浏览器逐帧捕获后由 FFmpeg 编码成 MP4,全程在 Agent 内完成、不打开剪辑软件。

  2. Latent.Space(@latentspacepod)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Code 实用技巧:用 Artifacts 做多人共享上下文,用 /eli5 插件快速理解

    Claude Code 社区分享了一组实用技巧:从单机模式走向多人协作,多用 Artifacts 作为队友、其他线程和 subagent 的共享记忆上下文,只需让 Claude 把它做成 artifact 即可。用 `/eli5` 插件可让 Claude 用寥寥数语讲清全局,比读大段文字更有用。此外,真正的瓶颈是"未知的未知",解法是多尝试、多迭代以培养直觉与品味。

  3. Viking(@vikingmute)AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用 ChatGPT 通过 CDP 操作 Chrome 或 grok bot 云端操作,都被网站反自动化打到空白页

    为给简单简历做 BOSS 直聘插件,用 ChatGPT 通过 CDP 操作 Chrome,或用 grok bot 云端操作,都会被网站直接打到空白页。作者称 GitHub 上的 loks666/get_jo 仓库及相关讨论让自己大开眼界,其中既有 AI 时代的各种巧思,也有针对自动化反制手段的干货讨论。

  4. AWS Architecture BlogAI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用 AG-UI 协议、智能体集群与 Amazon Nova Act 在 AWS 上构建自适应 AI 界面

    AWS 展示如何用 AG-UI 协议、Strands Agents SDK 的 Swarm 模式和 Amazon Nova Act 构建能随 AI 输出变化自动调整的界面。

  5. 阿里技术AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    阿里稳定性团队 AI Native 研发实践:用 Skill 与 Plugin 约束 AI 生成的前端代码

    阿里稳定性团队复盘 AI Native 研发转型:当后端、产品、设计师都能用 AI 写前端,代码能跑却难接手,于是把团队判断做成结构化规则包 Skill,并打包为 Claude Code Plugin「Anchor」。

  6. Clip设计夹AI 评估 · 25/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI-PPT 实操:在 WorkBuddy 里用美图设计室 PPT Skill 从草图生成高质 PPT

    美图设计室 PPT Skill 接入 WorkBuddy,用户把会议纪要 Word 草稿拖进对话框、附上参考图和提示词,即可直接生成完整的 8 页汇报 PPT,无需切换软件。生成结果按封面、目录、整体进度、模块进展组织,采用结论式标题与模块化内容并自动高亮重点数据,支持单页精准修改和一键跳转美图设计室画布做 3D 图标等微调。最终导出标准可编辑 PPTX 源文件,而非锁死的图片或 PDF。

  7. Qdrant(@qdrant_engine)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qdrant 解析:更换嵌入模型为何通常需要重新嵌入全部文档

    在 Qdrant 中,文档经嵌入模型转为向量存储,用户查询也需转成同一向量空间的向量才能比对。问题在于更换嵌入模型通常意味着必须重新嵌入已有文档。

  8. dbaplus社群AI 评估 · 54/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    腾讯技术工程详解 Agent 自进化飞轮:评测、记忆、落地、控制四齿怎么搭

    腾讯技术工程提出一套 Agent 自进化方法论,把评测、记忆、落地、控制四个环节作为同一闭环的四个齿轮,主张自进化的瓶颈不在单个技术点,而在环节之间的数据通路是否连通。

  9. LlamaIndex 🦙(@llama_index)AI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LlamaIndex 探讨 Jev 及同类模型在文档解析早期方案中的应用

    LlamaIndex 探索了 Jev 及同类模型在文档解析任务上的早期方案,涉及方向检测、语言检测、路由等任务。文档解析需要大量即时决策。

  10. Stack Overflow BlogAI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    为什么模型版本管理不足以支撑生产级 AI

    生产级 AI 应用仅靠模型版本无法保证可复现,检索、提示词、工具契约与推理服务配置都会独立改变行为。文章建议用版本化发布清单(含模型、提示词、索引、嵌入、运行时修订号)统一界定发布边界,并以覆盖端到端路径的评估门禁和经过演练的回滚路径作为 MLOps 起点。

  11. Simon Willison(@simonw)AI 评估 · 29/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Simon Willison 发布 Devs World Congress 主题演讲笔记与注释版文字稿

    Simon Willison 为其在圣何塞 Devs World Congress North America 所做主题演讲发布了详细笔记和注释版文字稿,梳理 2026 年至今 LLM 与智能体的全部进展,演讲于上周五进行。

  12. Stack Overflow BlogAI 评估 · 53/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    你的 Human-in-the-Loop 是否正在拖慢你?我们的实践总结

    Stack Overflow 博客总结团队的分层 human-in-the-loop 实践:Prediction Router 按置信度把决策分三层,Tier 1 自动验证处理约 85% 流量、延迟低于 3 毫秒,Tier 2 异步专家复核约 12% 案例、4 到 6 小时完成,Tier 3 约 3% 高风险场景实时人工介入并设 30 到 60 秒确认窗口。

9月28日周一
  1. Justine Moore(@venturetwins)AI 评估 · 65/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    如何用 Claude 复刻 a16z 数据中心宣传片

    Justine Moore 以 a16z 的 It's Time to Build 视频为参考,让 Claude 制作一支数据中心主题的类似短片,并让 Claude 复盘了自己的制作流程。

  2. Viking(@vikingmute)AI 评估 · 45/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    content-gate:基于 Google Search Central 官方文档的 AI 写 SEO 文章 skill

    作者把自己的 SEO 文章写作流程做成了一个叫 content-gate 的 skill,用于让 AI 撰写 SEO 类文章。该 skill 基于 Google Search Central 官方文档的内容质量与合规指南,配有发布前 checklist 供 AI 自查,并提供双语本地化指南——按目标语言写作而非逐句翻译。项目已开源在 GitHub,作者已用它写过一部分文章。

  3. idoubi(@idoubicc)AI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    实时查看 Agent 的每一个请求

    实时查看 Agent 的每一个请求。该内容由 xgo.ing 提供支持,帖子获得 688 次浏览。

  4. 京东技术AI 评估 · 25/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    京东零售 Forge Agent 如何用 Agentic 重塑搜推数据生产体系

    京东零售构建了以 Forge Agent 为统一 AI 门面、Sindri Plugin/MCP 为确定性工具、Sindri 后端负责规划与提交、ADF 承载 DAG 与调度生命周期的人工智能数据研发链路。

  5. 小红书技术REDtechAI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    小红书直播:3 周交付 40+ 需求、千万级 PCU 零事故的三套技术底座

    小红书直播用架构、性能、稳定性三套递进能力,在 3 周窗口内交付 40+ 世界杯需求,赛事期实现千万级 PCU 零事故。端到端进房成功率场均 99.5%+,三端异常退出率均低于万分之一,降级后 CPU 均值降幅接近 60%、温升降幅约 30%。全部赛事零事故,赛中调整全部通过配置完成、无需发版。

  6. 山行AIAI 评估 · 63/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenShorts:把长视频切片、AI UGC 和分发做成一条开源流水线

    OpenShorts 是一个把长视频切片、AI UGC 生成与跨平台发布整合到同一后端和素材体系的开源项目,截至 2026 年 9 月 28 日约有 5700 Star、1300 Fork,核心应用采用 MIT License。

  7. 大淘宝技术AI 评估 · 35/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    大淘宝技术团队 Ontology 决策结构化实践:不预画 workflow,让 Agent 全托管 120+ 工作项

    大淘宝商家财务团队用 Ontology 四层图谱(业务/系统/交付/治理)加 decision_function 结构化决策,替代预设 workflow 和打包 Skill,让 Agent 按"先取证、再决策、后行动"闭环动态生成流程,3 个月在 Agent Room 完成 120+ 需求与工作项,覆盖需求开发、工单处理、数据订正和业务运维。

  8. Geek(@geekbb)AI 评估 · 39/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Magpie 接上 DeepSeek 并叠加 RTK,Bash 工具输出 token 省七成多

    Magpie 接入 DeepSeek 后 prompt 成本已压得很低,再叠加一层 RTK 过滤 Bash 工具输出的噪声,实测可省掉七成多的工具输出 token。两个省钱方向叠加后性价比明显提升。

  9. 优设AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    优设整理10个去AI味Skill,覆盖提示词优化与文本改写

    优设整理了10个实用的去AI味Skill,覆盖提示词优化、AI痕迹检测、文本改写和文风塑造。机械句式、翻译腔和套话废话基本都能找到对应工具,公众号、小红书、口播稿和长文章可按问题直接选。在GitHub顶部搜索栏输入对应Skill名字即可获取。

  10. 架构师之路AI 评估 · 33/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI时代每秒10W并发无锁缓存,spec怎么写?

    针对每秒20w写、1k读的写多读少定长value场景,无锁缓存通过写入定长value加16bit CRC签名、读取时校验签名,签名不一致则返回NULL视为cache miss,以牺牲一致性换取零锁冲突。

  11. 数字生命卡兹克AI 评估 · 63/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GPT-Image 2.5 的 12 种照片编辑玩法与提示词整理

    作者整理了 GPT-Image 2.5 的 12 种照片编辑玩法,并给出可直接复制的提示词,涵盖消除背景游客、自动调光、专业美颜等基础修图。创意部分包括拍立得 3D 公仔、景点明信片、主体转贴纸、旅游碎片行李箱和人物旅游海报,网感部分包括演唱会氛围感、美食炸弹和指定物体转文字涂鸦、ins 风画面注释。

9月27日周日
  1. 浮之静AI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    浅谈 AI 进化史:从 ChatGPT 到 Agent 工作系统

    从 2022 年 11 月 30 日 ChatGPT 上线到 2026 年 9 月,AI 用不到四年从聊天框走向完整任务执行:LangChain、RAG 和 MCP 接上外部世界,Codex、Claude Code、Cursor 转向仓库级编程 Agent,Agent Skills 与 AGENTS.md 沉淀协作经验。

  2. Viking(@vikingmute)AI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    两条 SEO 黑科技:YouTube 视频卡抢占关键词,Google 全家桶加速索引

    两条 SEO 技巧被分享:一是在 YouTube 拍 How-to 教程、产品对比、工具评测类视频,这类 video keyword 的搜索结果里 Google 常直接出视频卡,小频道视频有时能压过权威博客,种子词建议用产品真实使用场景而非硬广。

  3. 印记中文AI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    React 中文周刊 #294:GitHub Copilot 桌面端如何渲染百万行 PR

    GitHub Copilot 桌面应用基于 React 与 Tauri 构建,为渲染 2000+ 文件、百万行改动的 PR,将代码行渲染放到 React 之外。

9月26日周六
  1. Viking(@vikingmute)AI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用这个技巧做 i18n 审核:解决中英文长度差异导致的界面错乱

    有开发者指出,这个技巧最实用的方向之一是 i18n 审核:不同语言字符长度不同很容易把界面搞乱,中文和英文的长度差异尤其明显,用这个技巧效果很好。

  2. Viking(@vikingmute)AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Viking 分享让 agent 用极端数据做 worst-case 布局的 UI 检查方法

    Viking 分享了一个设计与交互技巧:让 agent 往界面里塞各种 edge case,比如超长或超短文本、各种极端数字,观察 worst-case 布局表现,再对着截图做 UI review 并按问题清单修复。

  3. 山行AIAI 评估 · 59/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 金融 Agent 参考架构解读:从研究、建模到 KYC 都要人工签核

    Anthropic 开源 financial-services 仓库,提供面向投行、股票研究、私募股权、基金运营和财富管理的金融 Agent 参考实现,把金融工作拆成命名 Agent、垂直 Skills、MCP 数据连接器和 Managed Agent Cookbooks 四类可复用资产。

  4. 花叔AI 评估 · 54/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    花叔发布「闪电.skill」:用 Anthropic 方法论把产品提速 3 倍

    花叔基于 Anthropic 工程师复盘 claude.ai 与 Claude 桌面端两周提速约 3 倍的方法,整理出开源 skill「闪电.skill」,含 8 个步骤和测速、棘轮两个脚本,可通过 npx skills add alchaincyf/huashu-flash 安装。

  5. Fireworks AI(@FireworksAI_HQ)AI 评估 · 37/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Fireworks AI 发布 RL 训练 cookbook,联合 HUD 免自建基础设施微调模型

    Fireworks AI 发布新 cookbook(联合 HUD),让开发者无需自建基础设施即可在自己的任务上做 RL 训练。流程是在 HUD 中定义任务和 grader,再在 Fireworks 上采样并训练模型,同一环境同时用于训练和评估。

9月25日周五
  1. AI产品黄叔(@PMbackttfuture)AI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    opus 5.5 一句话把 tokenrank 榜单数据做成爆款视频

    有人在社群里用一句提示词让 opus 5.5 基于 tokenrank 榜单的多维数据和参赛者信息直接生成一条爆款视频,目标受众是已付费用户。该视频全部由模型独立完成,一次生成成功,未做人工剪辑。

  2. Viking(@vikingmute)AI 评估 · 59/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenClaw 的 test audit 技能:先答四个问题再决定是否加测试

    Viking 分享了 OpenClaw 自己使用的 test audit 技能(github.com/openclaw/openc…),其任务是告诉 agent 什么测试应该加、什么测试是垃圾不应该加,开始写测试时 agent 要先回答四个关于是否有必要加测试的问题,判断通过才加。

  3. orange.ai(@oran_ge)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    藏师傅用 Opus 5.5 做 CodePilot 产品宣传视频 skill 测试

    归藏(藏师傅)用 Opus 5.5 为 CodePilot 产品一键生成了一支产品宣传视频,称其在图像图形类前端表现突出,效果"吊打"他所说的 GPT-6 Astra。他表示后续会把相关经验沉淀进自己的 guizang-product-video-skilll,让较弱的模型也能获得不错的效果,并已就此展开 skill 测试。