跳到正文

全部动态

今日 33 条
9月23日周三
  1. 腾讯技术工程AI 评估 · 41/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    腾讯错误码治理 Agent:3~8 小时排查缩短到分钟级,action_type 一致率从 66% 提升到 88%

    腾讯技术工程基于智能体编排平台搭建错误码治理 Agent,把知识库、代码关系图谱、可观测平台和代码托管平台四类能力挂载到同一个 Agent,由它自主编排五步排查流程,分钟级产出根因分析与修复建议。

  2. 腾讯研究院AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    从 EURISKO 到 GPT-5.6:一份讲清 RSI(递归自我改进)的科普综述

    OpenAI 在 2026 年 7 月发布的 GPT-5.6 首次把自我改进列为评测科目,其 RSI 指数从 GPT-5.5 的 41.7% 升至 GPT-5.6 Sol 的 57.9%,相差 16.2 个百分点。文章按四条标准(持久改进、自主闭环、递归增益、稳健可控)划分 RSI 层级,指出前两层已有实现,递归自我加速尚无充分公开证据。

  3. 小米技术AI 评估 · 19/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    小米黑客松 Sensaro OS:用 Xiaomi MiMo 让智能家居从听懂指令到理解意图

    小米黑客松 Sensaro OS 团队在 48 小时内基于 Xiaomi MiMo 赛道搭建了一套智能家居系统原型,把用户意图转化为包含目标、作用范围、动作、安全边界和时长的“Sensaro State”,而非单条设备指令。

  4. 阿里技术AI 评估 · 29/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    阿里发布《AI Native 研发范式实践手册》,提出企业级 Agent 基础设施三大缺口

    阿里巴巴在云栖大会发布《AI Native 研发范式实践手册》,从 AIDC 数字投手、千问用增 Agent、万有无界三个业务案例提炼出环境与验证驱动、平台能力升级、提效度量、数字员工、组织配套五个共性挑战。

  5. 大淘宝技术AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    淘天团队自迭代小游戏 Agent:两周上线 6 款游戏,3 天迭代 12 款

    淘天营销&交易技术团队公开了一套覆盖小游戏选型、生产、上线与迭代全链路的多 Agent 系统,由人定义北极星指标与行动边界并审核关键方案,AI 负责策略、开发与数据归因。

  6. 优设AI 评估 · 54/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI时代Vibe Design必备的10种UI风格名词

    优设整理了一套AI做界面常用的10个UI风格和界面名词卡片,涵盖Editorial Design、Swiss Style、Glassmorphism、Grain & Noise,以及AI产品常见的Prompt-bar-first和Agent Status等。每种风格都附有适用场景、避坑提醒和可直接放进提示词的关键词,另附一张10种风格速查表,供写Prompt时参考。

  7. 腾讯云开发者AI 评估 · 56/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI 写得快不等于真正提效:Harness 的记忆与验证闭环

    作者认为用 AI 写代码时记忆缺失、改完即停、会犯错是三个主要断点,因此给 AI 套上一层 Harness 系统。做法上先建两级索引知识库并只记阴性知识、代码位置索引和隐含关联关系,再用 hook 硬拦截让 AI 先读索引;随后用访问、提交、等待、本地验证四个 skill 补上手脚,并把排查到线上验证的步骤写死成 close-loop 等 command。

  8. Modal BlogAI 评估 · 61/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Modal 如何为万亿参数编码智能体服务万亿 token:Kimi K2.6 推理优化实践

    Modal 分享了为 Moonshot AI 的 Kimi K2.6 模型优化推理服务以支撑编码智能体的实践,单副本每用户性能提升 2.8 倍、跨用户提升 5.6 倍。

  9. Suhail(@Suhail)AI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Perplexity 用提示引导自蒸馏训练 Computer 模型,工具调用失败率降低 21.2%

    Perplexity 通过提示引导自蒸馏(hint-guided self-distillation)对 Computer 模型进行后训练,让模型从自身错误中学习。在一次线上 A/B 测试中,较晚训练的 checkpoint 相比早期 checkpoint 将工具调用失败率相对降低 21.2%。

  10. LangChain BlogAI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    医疗 AI 的可靠性层:LangSmith 的典型用例

    LangChain 发文介绍 Included Health 与 Abridge 如何用 LangSmith 将稀缺的临床专家评审转化为可复用资产,包括标注数据集、校准后的评估器和自动化发布门禁。

  11. bolt.new(@boltdotnew)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Bolt 那些被跳过却最影响构建效果的功能

    Bolt 官方指出,对构建效果贡献最大的功能往往被用户跳过:增强提示词、plan mode、在不同功能间清空上下文,以及小改动时切换到更轻量的模型。这些功能都不显眼,但效果会持续叠加。

  12. Milvus(@milvusio)AI 评估 · 44/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Milvus 团队将 Jev 集成进 DeepSearcher、MemSearch 与 Vector Graph RAG 三个开源项目

    Milvus 团队把 Jev 集成进 DeepSearcher、MemSearch 和 Vector Graph RAG 三个开源项目做验证。在 DeepSearcher 的 100 道多跳问题上,Jev 以 93.25% Recall@5 追平 DeepSeek V4 Flash,中位决策延迟从 2.23s 降至 0.55s,API 成本约为其七分之一。

  13. Alex Albert(@alexalbert__)AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude 用 Blender 重建 1906 年旧金山市场街震前街景

    一条 Claude 提示词要求用 Blender 重建 1906 年 4 月 17 日下午的旧金山市场街,从 Ferry Building 到 Fifth Street,涵盖 Palace Hotel、Call Building、Chronicle Building、Lotta's Fountain 和 Emporium。

  14. bolt.new(@boltdotnew)AI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Bolt 中那些被跳过却最影响构建效果的功能:增强提示词、plan mode 与清理上下文

    Bolt 官方指出,对构建效果贡献最大的几项功能恰恰最容易被跳过:增强提示词(Enhance prompt)、plan mode、在功能之间清理上下文,以及小改动时切换到更轻量的模型。这些功能都不起眼,但效果会持续累积。

  15. Visual Studio BlogAI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    如何在 Visual Studio 中调试 C# 生产环境崩溃:用内存转储与 Copilot 分析 Parallel Stacks

    Visual Studio 演示了用内存转储事后调试 C# 生产崩溃的流程:监控 ThreadPool,任务超过 3 秒阈值即调用 Windows API 生成 .dmp 文件,再用 Debug with Mixed 打开。

9月22日周二
  1. Qdrant(@qdrant_engine)AI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qdrant 分享 SPLADE 与神经搜索,无需查询时推理

    Qdrant 的 KShivendu 在 Retrieval Augmented Gathering 活动上分享如何用 SPLADE 做神经搜索,且无需查询时推理,活动时间为美东时间当天下午 1 点。Doug Turnbull 推荐对 SPLADE 和神经搜索感兴趣的人关注。

  2. NVIDIA Technical BlogAI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用 AI Agent 和 NVIDIA Isaac ROS 加速 ROS 2 节点

    NVIDIA 介绍如何借助 AI Agent 与 Isaac ROS 加速 ROS 2 节点:即使 CUDA kernel 很快,消息在节点间仍可能经 CPU 内存序列化或拷贝,抵消 GPU 上感知与 AI 负载的收益。此次通过上游抽象与 NVIDIA 近期推出的 CUDA buffer 后端来消除这一瓶颈。

  3. 腾讯技术工程AI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    腾讯15年资深后台工程师,转战大模型推理的抉择

    腾讯T12资深搜索后台工程师吴银光在2025年初卸下管理头衔,转入大模型推理工程团队,从性能评测、服务部署等周边工作起步并深入阅读 SGLang 源码。他梳理出推理工程入门路径:建立 Transformer 结构认知、掌握 TTFT/TPOT/QPS 等评估指标、了解 MoE 与 MLA 等结构演进,再选 PD 分离、分布式 KV Cache、推测解码等方向深挖。

  4. 卡尔的AI沃茨AI 评估 · 71/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    我把463个AI视频做成Skill和提示语模版,全都开源

    作者开源了awesome-seedance项目,用真金白银复现463条AI视频提示语,蒸馏出14个覆盖各类视频的提示语模版和25个Skills。项目每条提示语都经过实测复现并打分分类,用gpt、claude、grok、deepseek四个多模态模型复测打分、聚类和起标题,每天自动收录GitHub、抖音、小红书、X上带提示语的case。

  5. Tw93(@HiTw93)AI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Tw93 将 Mac 软件兼容测试集从 300 个扩至 549 个,覆盖 App Store 版本与浏览器扩展插件

    独立开发者 Tw93 把已验证的 Mac 软件兼容测试集从 300 个增加到 549 个,补充了 App Store 版本和扩展插件。他借助大模型和 computer use 能力,通过脚本定位 App 的无障碍元素实现自动化操作,并将其归因于 Mac 上 computer use 体验优于 Windows。

  6. NVIDIA Technical BlogAI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NVIDIA 如何评估 AI 智能体:从工具调用到任务完成

    NVIDIA 提出 AI 智能体评估需从单一函数调用打分转向整个任务完成度,核心是能否在真实环境中连续执行数十次工具调用并在某步失败后恢复。仅评估模型回答是否"听起来对"几乎无法说明任务是否真正完成,这正是智能体评估必须演进的原因。

  7. SemiAnalysisAI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    MoE 推理的计算与数据搬运:Prefill、Midfill、Decode 四阶段解析

    SemiAnalysis 解析 MoE 推理的计算与数据搬运,将模型服务拆为 Prefill、Midfill、Decode attention、Decode experts 四种运行模式,各自对算力、内存和网络的需求不同。

9月21日周一
  1. Milvus(@milvusio)AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jev 能否替代 RAG 中的 reranker?在 Milvus 短名单上实测三种方案

    在 Milvus 短名单上对 80 条 SciFact 查询实测三种方案:qwen3.7-text-rerank 将 nDCG@10 提升 0.0446,Jev 提升 0.0778,排名最优。但 Jev 的 P50 重排延迟是 qwen 的 10.2 倍,单次运行成本约为 6.7 倍。以 0.5 为阈值直接按概率过滤时,top-5 精确率 49.4%,但有 18.8% 的金标准相关文档被滤除。

  2. LangChain BlogAI 评估 · 56/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LangChain 实测 TypeSafe AI 的 Jev 能否成为更好的 Agent 评估器

    LangChain 用 Deep Agents 构建天气 agent,在 LangSmith 数据集上对比 TypeSafe AI 的 Jev 与 GPT-5.6 Luna、GPT-5.6 Terra、Claude Sonnet 4.6 三种 LLM 评委。

  3. Qdrant(@qdrant_engine)AI 评估 · 44/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qdrant 实验:向量检索候选深度如何影响重排序效果

    Qdrant 在五个公开数据集上实验了向量检索的候选深度:若最终只要 5 条结果,先召回 100 个候选能给重排序或融合阶段更多素材。把 limit 从 10 提到 500,最优可能的 nDCG@10 最多提升 0.28,但实际得分变化不超过 0.01——有时文档已被召回,只是排名不够高。

  4. LovartAI(@lovart_ai)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Lovart 提示词玩法:让 AI Agent 填满容器两面的自我认知测试

    Lovart 上流传一个提示词玩法:把图片交给 AI Agent 并问它"根据你知道的关于我的一切,把这个容器两面都填满",会得到很有意思的结果。该玩法由 Penny777 分享,原句为"Lovart, tell me everything you know about me and fill both sides of this container."

  5. AI产品黄叔(@PMbackttfuture)AI 评估 · 8/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用 GPT live 讨论:好环境下模糊想法更快收敛的小技巧

    在心情愉悦、环境舒适时打开 GPT live 讨论,模糊的想法能更快收敛成型。这条来自 AI 产品黄叔的个人技巧帖认为,好的外部环境配合 GPT 的实时语音对话,有助于把还没想清楚的点子快速聚焦。帖文未披露所用模型版本或具体产品形态。

  6. Clip设计夹AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    一张平铺图批量测款:美图设计室 AI 服饰穿戴工作流实测

    美图设计室支持上传一张商品平铺图,即可批量生成不同模特、姿势与场景的穿戴效果图,并支持AI服装换色出SKU变体图、替换服装与灵活切换模特场景。首页对话框还可一句话生成模特套图、1:1复刻同行爆款图的背景与版式,以及一站式生成带脚本、运镜、转场和背景音乐的带货视频;生成素材可存入资产库沉淀品牌视觉资产。该工具已首批接入WorkBuddy、Codex等主流大模型,并支持手机APP出图。

  7. GitHub(@github)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GitHub Podcast 聊开发者正在学习的 AI 术语

    GitHub Podcast 最新一期讨论软件开发中涌现的一批 AI 新词汇,聚焦开发者当下正在学习的 AI 术语。节目可在 github.blog 的 AI 与机器学习板块收听。

  8. GitHub(@github)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GitHub 法务团队如何更多使用 Copilot CLI

    GitHub 法务团队正在用 Copilot CLI 处理更多法律相关工作,相关做法在 GitHub 官方博客的 AI 与 ML 板块公开分享。帖子未披露具体模型版本、参数或性能数字。

9月20日周日
  1. Tw93(@HiTw93)AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    为让 Mole 清理更彻底,我用 AI 装了 300 多款 Mac 软件做卸载测试

    为让 Mac 清理工具 Mole 卸载更彻底,作者整理 300 多款 Mac 软件共约 100 多 G,分成 30 组,用最强 Extra High Fast 模型借 computer use 每次 10 个自动下载、安装、卸载并查找残留。过程补充了 13 类通用规则、90 多条精确清理路径,修正 30 多个误清点,并新增 100 多条单元测试。

  2. AI产品黄叔(@PMbackttfuture)AI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    飞书 CLI 支持搜索公开文档后,我用 Codex 批量关闭个人云文档

    飞书 CLI 已支持搜索公开文档,有用户在即刻看到相关提醒后实测确认可用。该用户随后让 Codex 批量关闭了自己大部分个人飞书云文档的公开阅读权限,并建议其他人也尽快检查自己的飞书云文档是否有需要关闭的公开部分。

  3. 优设AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI寓言绘本更新《守株待兔》:新国风绘本风还原完整故事

    AI寓言绘本系列更新《守株待兔》,采用新国风绘本风格,固定农夫、树桩、田地等元素以保证前后画面像同一本故事书。配色以土黄、灰绿、米色为主并加入纸张纹理,靠人物表情和庄稼从整齐到荒废的变化推进剧情。作者表示连续剧情的关键是人物与场景一致性,完整提示词可在评论区索取。

  4. 夕小瑶科技说AI 评估 · 59/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    完整教程:用 GPT-6 Astra+Blender 从零开始搭建一个3D 手势交互机器人

    作者分享用 GPT-6 Astra、Meshy 和 Blender 把个人 IP 夕小瑶做成 3D 手势交互网页的完整流程,网页已上线可体验。

  5. 快手技术AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    快手电商直播如何落地业界首个大规模实时字幕系统 Live Captioning Engineering

    快手电商直播技术团队将"主播说话到字幕上屏"端到端耗时从1.5~2秒压缩到400~500毫秒,字错率(CER)从7.81%降至3.51%,并支撑千万级持续并发分发。系统按"拉流—识别—对齐—分发—渲染"链路建设,用 PTS 队列统一媒体时间线,以房间事件加两级级联实现一份计算多方消费,客户端按播放器 PTS 驱动字幕渐进吐字与修正。

  6. GitHub(@github)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GitHub 分享从原型到生产的 LLM 评测实践

    GitHub 指出,语言模型在干净 benchmark 上表现优异,仍可能在真实场景的关键 case 上失败。GitHub 分享了帮助其从有前景的原型结果走向生产的评测实践。

9月19日周六
  1. 优设AI 评估 · 51/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    4个避坑技巧,教你摆脱AI海报的廉价科技感

    作者从做AI海报的经验出发,指出画面元素多却仍显模板化、廉价科技感的问题,多出在风格词太空、信息层级太乱、装饰元素太多和提示词没说清楚这几点。文章按这几个常见问题给出改法,包括控制信息量、拉开主次、把高级感说得更具体,以及海报提示词该按什么顺序写。

  2. 卡尔的AI沃茨AI 评估 · 56/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用 QBS 方法把陌生领域方法论快速做成 skill

    作者分享从 X 上看到的 QBS 方法,让 GPT-6 针对卡住的问题找一本相关书籍、读完相关章节,再把方法提炼成可直接使用的规则 skill,并用新任务试跑验证,流程为 Question 问题到 Book 书籍再到 Skill。

  3. AI产品黄叔(@PMbackttfuture)AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用夸克网盘 Skill 在线提取视频逐字稿:30 分钟音视频不到 1 分钟转完

    夸克网盘 Skill 可在线提取视频逐字稿,88VIP 用户可无限使用,支持多路同时转写,平均不到 1 分钟完成 30 分钟音视频转写,后续可用 DeepSeek API 润色。此前作者用本地 FunASR 转写太吃电脑资源,也曾改用 GrokBot 云端处理。

  4. 袋鼠帝AI客栈AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    WorkBuddy 接入 Miora,袋鼠帝开源 3 个 AI 短片制作 Skill

    袋鼠帝把 AI 短片制作流程沉淀为 3 个 Skill 并开源:视觉资产提示词、动作打戏提示词和 Miora 视频执行规范,可直接装入 WorkBuddy 使用。