为什么 Agent 时代,CLI 反而成了最优解?——Podwise CLI + Skills 发布
Podwise 发布 CLI 与 Skills,选择以命令行而非 API / SDK 作为主要接口,让 Agent 直接调用播客内容。
Podwise 发布 CLI 与 Skills,选择以命令行而非 API / SDK 作为主要接口,让 Agent 直接调用播客内容。
字节跳动的 DeerFlow 登上 GitHub 趋势榜第一。文章围绕其智能体记忆(agentic memory)的工作机制展开解析,相关内容由 mem0(@mem0ai)发布。
FlowiseAI 在 GitHub 上更新了 Flow 项目,推文附带仓库链接,获得 10 次点赞、3 条回复和 2264 次浏览。原文未披露具体版本号、功能或参数细节。
37signals 将 Campfire、Writebook、Fizzy 以宽松许可证开源后,又推出名为 ONCE 的应用服务器,可在单台机器甚至笔记本上同时运行这一整套应用。该服务器提供终端界面查看 RAM、CPU 占用及访客数与每秒请求数,并支持零停机升级和定时备份,一条命令即可安装。
Jina AI 发布面向智能体的官方 CLI,项目地址为 github.com/jina-ai/cli。该工具由 xgo.ing 提供支持。
Jina AI 分享了音频向量模型的构建方法:从 Qwen2.5-Omni 中拆出音频编码器接到小 LLM backbone 上,模块组合方案以 1.1B 参数量在 AudioCaps T2A cvR@5 上达到 49.7,超过 CLAP 的 42.0,且只用了 CLAP 约 1/25 的训练数据(181K 对)。
Modal Sandboxes 推出 Directory Snapshots,可单独快照指定目录并在新 Sandbox 中独立于基础镜像挂载,便于分离系统依赖与应用代码、预热 Sandbox 池并加快初始化。
NVIDIA 团队训练了一个 42M 的 Transformer 模型 SONIC 用于控制人形机器人全身动作,并开放代码和模型检查点。该模型以人类动捕数据做逐帧监督,将运动跟踪作为全身控制的统一可扩展任务,数据本身即隐含奖励函数。
42M 模型用人类动捕数据替代手工奖励设计,并开源代码与检查点,对具身智能研究者是可复用的训练范式。
NVIDIA 发布世界模型 DreamDojo,项目网站 dreamdojo-world.github.io 与论文 arXiv 2602.06949 已上线,代码仓库和模型 ckpts 已在 GitHub 的 NVIDIA/DreamDojo 开放。该项目由 NVIDIA 内部大团队协作完成。
Lex Fridman 发布了他与 OpenClaw 创作者 Peter Steinberger(@steipete)的对话,内容已在 YouTube、Spotify 和 Lex Fridman 播客上线。该期节目相关推文获得约 561 个点赞、61 条回复和 63 次转发。
Jina AI 上线嵌入向量反演演示 embedding-inversion-demo.jina.ai,可实时展示从嵌入向量还原内容的效果,训练与解码的技术细节在其开源仓库和论文中公布。
一个 78M 参数的文本扩散模型能从 Qwen3-Embedding 和 EmbeddingGemma 的嵌入向量中还原出 80% 的 token,并支持多语言输入,配套 demo 可在线体验。该模型展示了嵌入向量逆向还原为句子的难度之低,而这正是文本扩散模型的理想任务。
Jina AI 公开了 jzip 的 C 实现代码与配套论文,前者托管在 GitHub 的 jina-ai/jzip-c 仓库,后者发布于 jina.ai 的 embedding-comp 页面。两条链接均通过推文直接给出,供开发者查阅实现细节与压缩方法。
Jina AI 发布 jina-embeddings-v4 向量的可视化结果,显示指数集中塌缩到 127 这一单一主值,指数熵从 2.6 降至 0.03 bits/byte。仅靠指数压缩只能得到 1.1x 压缩,额外收益来自高阶尾数字节:当角度聚集在 π/2≈1.5708 附近时,其熵从 8.0 降至 4.5 bits,两者合计实现 1.5x 压缩。
Jan Leike 转发推荐了一个开源实现,由 @kaifronsdal(该图表数据提供者)、@sleepinyourhat 及多位贡献者共同完成,代码托管在 GitHub 的 safety-research 仓库下。原文未披露该实现的具体功能与技术细节。
Mem0 发布 2025 年度回顾:推出首篇 Mem0 研究论文、OpenMemory MCP 和 OpenMemory Chrome 扩展,GitHub 星标超 44k,Python 包下载量超 18M,并完成 2400 万美元融资。AWS 将其选为新一代 Agent SDK 的独家记忆提供商,Mem0 还原生集成进 CrewAI、Flowise 和 Langflow 等智能体产品。
Mistral AI 发布 Devstral 2 编码模型家族,提供两个尺寸版本,均为开源。同时推出原生 CLI 工具 Mistral Vibe,用于端到端自动化。作者称其支持在家进行 SOTA 开源 vibe coding。
Jina AI 发布视觉语言模型 jina-vlm,相关论文(arXiv 2512.04032)与 HuggingFace 模型权重已同步公开,并在官方博客介绍了该模型。目前仅公布了 arXiv、HuggingFace 和博客三条发布链接,模型参数规模、benchmark 分数与价格等细节尚未披露。
FlowiseAI 在 GitHub 上发布了 Flow 项目更新,并附上仓库链接。原帖互动数据为 0 条评论、0 次转发、6 次点赞、2823 次浏览。
FlowiseAI 近期收到贡献者 @aibysid 提交的一系列 PR,为其 AI 智能体可视化构建器加入多项功能。更新包括 ChatOpenRouter 节点支持图像上传、Agent 节点可输出结构化 JSON、新增支持多提供商 OCR 的图像加载器,并改进 Hugging Face 推理 API 集成及删除 AgentFlow 后列表自动刷新等体验。
DeepSeek-V3.2-Exp 推理 demo 的早期版本存在 RoPE 实现不匹配问题:indexer 模块的 RoPE 期望非交错输入,MLA RoPE 期望交错输入,可能导致性能下降。该问题已在 deepseek-ai 的 GitHub 仓库修复。
Qwen Code v0.2.1 发布,开发团队在 17 天内连发 8 个版本(v0.1.0 到 v0.2.1),重心放在修复用户反馈的 bug 而非添加新功能。
Modal 的 Volumes v2 开放 Beta,支持更高吞吐、更强随机访问性能和数百容器并发写入,且取消文件数量上限;JavaScript/TypeScript 与 Go SDK 以 v0.5 进入 Beta,提供统一的 Client 对象并支持 Sandboxes、Functions、Images 和 Volumes。
FlowiseAI 发布新版本,包含来自社区的大量小幅改进和 bugfix。完整 release note 已在 GitHub 上公布,官方对社区贡献者表示感谢。
DeepSeek 在 OpenSourceWeek 第 3 天发布 DeepGEMM,一个支持稠密和 MoE GEMM 的 FP8 GEMM 库,已用于 V3/R1 的训练与推理。
DeepSeek 宣布将于下周启动 OpenSourceWeek,陆续开源 5 个代码库。这些模块已在 DeepSeek 线上服务中完成文档化、部署并经过生产环境实战验证,将每日解锁发布。
DeepSeek 发布完全开源的推理模型 DeepSeek-R1,性能对标 OpenAI-o1,采用 MIT 许可,可自由蒸馏和商业化。官网与 API 已上线,可在 chat.deepseek.com 体验 DeepThink。
扩散模型已从图像合成扩展到视频生成,需额外处理帧间时序一致性并依赖更多世界知识。从零训练路线中,VDM 用 3D U-Net 将空间与时间操作分解处理,Imagen Video 则以 7 个扩散模型级联输出 1280x768、24 fps 视频,并通过渐进蒸馏将采样步数降至每个模型 8 步。OpenAI 的 Sora 则改用 DiT 架构,在视频与图像潜码的时空 patch 序列上运算。
Eugene Yan 整理并发布了一份可商用许可的开放 LLM 清单,其中也包含面向代码微调的模型。清单上线两天内收到 8 个 PR,新增了更多模型,并经过讨论加入了上下文字段长度列,还修正了一个实际不具备商用许可的模型。该项目计划继续与社区协作补充数据集与评测。