<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>训练技巧 on WorldSense 技术笔记</title><link>https://www.worldsensetech.com/zh/tags/%E8%AE%AD%E7%BB%83%E6%8A%80%E5%B7%A7/</link><description>Recent content in 训练技巧 on WorldSense 技术笔记</description><generator>Hugo</generator><language>zh-CN</language><lastBuildDate>Mon, 17 Aug 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://www.worldsensetech.com/zh/tags/%E8%AE%AD%E7%BB%83%E6%8A%80%E5%B7%A7/index.xml" rel="self" type="application/rss+xml"/><item><title>跑 DreamerV3 该租云 GPU 还是自建工作站？一个工程师的成本账</title><link>https://www.worldsensetech.com/zh/articles/2026-08-17-dreamerv3-gpu-infrastructure/</link><pubDate>Mon, 17 Aug 2026 00:00:00 +0000</pubDate><guid>https://www.worldsensetech.com/zh/articles/2026-08-17-dreamerv3-gpu-infrastructure/</guid><description>&lt;p&gt;前面几篇文章讲了 DreamerV3 的环境搭建和训练技巧。但有一个更基础的问题经常被忽略：&lt;strong&gt;你在什么硬件上跑？&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;这个问题看似简单，实际上直接影响你的研究节奏和钱包。我用了一个月的 AutoDL 云 GPU，又花了一周时间规划自建工作站，中间还收到了供应商 ¥36,000 的整机报价。这篇文章把整个过程和算账结果分享出来，希望能给同样在纠结&amp;quot;租还是买&amp;quot;的朋友一个参考。&lt;/p&gt;
&lt;h2 id="先说结论"&gt;先说结论&lt;/h2&gt;
&lt;p&gt;如果你确认自己会长期维持较高的 GPU 使用率，自建工作站值得认真做一次成本测算。按照我实际使用的 ¥2.58/GPU 小时计算，每天 12 小时的简单静态平衡点约 29 个月，每天 18 小时约 19 个月。纯经济账并不意味着&amp;quot;买一定比租便宜&amp;quot;——12 小时并不是一个&amp;quot;买了马上省钱&amp;quot;的分界线。但高频研究场景下，本地机器在等待时间、环境稳定性和数据管理上的优势，可能具有更高价值。&lt;/p&gt;
&lt;p&gt;但&amp;quot;回本&amp;quot;不是唯一考量。自建工作站还有一个云 GPU 给不了的优势：&lt;strong&gt;随时可用、数据本地、不用排队、不用惦记关机省钱&lt;/strong&gt;。对于需要高频迭代的研究工作，这个体验差异是巨大的。&lt;/p&gt;
&lt;h2 id="第一阶段autodl-云-gpu-的实际花费"&gt;第一阶段：AutoDL 云 GPU 的实际花费&lt;/h2&gt;
&lt;p&gt;我最初的选择是 AutoDL——国内最常用的 GPU 云平台之一，按小时计费，机型丰富，不用自己维护环境。对于刚开始跑 DreamerV3 实验来说，这是最合理的选择。&lt;/p&gt;
&lt;h3 id="实际花费"&gt;实际花费&lt;/h3&gt;
&lt;p&gt;我实际使用的 AutoDL 实例折算下来约为 &lt;strong&gt;¥2.58/GPU 小时&lt;/strong&gt;（RTX 4090D 机型）。偶尔遇到过更低的短时优惠价（约 ¥1.67/h），但下面按 ¥2.58/h 这个实际常规价格估算月/年费用。&lt;/p&gt;
&lt;p&gt;两天花了 ¥100 左右。听起来不多，但换算一下：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th style="text-align: left"&gt;GPU 日均运行时长&lt;/th&gt;
					&lt;th style="text-align: left"&gt;月花费&lt;/th&gt;
					&lt;th style="text-align: left"&gt;年花费&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td style="text-align: left"&gt;每天 4 小时（轻度）&lt;/td&gt;
					&lt;td style="text-align: left"&gt;约 ¥310&lt;/td&gt;
					&lt;td style="text-align: left"&gt;约 ¥3,764&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td style="text-align: left"&gt;每天 8 小时（中度）&lt;/td&gt;
					&lt;td style="text-align: left"&gt;约 ¥619&lt;/td&gt;
					&lt;td style="text-align: left"&gt;约 ¥7,530&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td style="text-align: left"&gt;每天 12 小时（重度）&lt;/td&gt;
					&lt;td style="text-align: left"&gt;约 ¥929&lt;/td&gt;
					&lt;td style="text-align: left"&gt;约 ¥11,299&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td style="text-align: left"&gt;每天 18 小时（极限）&lt;/td&gt;
					&lt;td style="text-align: left"&gt;约 ¥1,393&lt;/td&gt;
					&lt;td style="text-align: left"&gt;约 ¥16,943&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;注意这只是 GPU 租赁费用，还没算存储费用（AutoDL 的系统盘和数据盘另计费）和网络传输成本。&lt;/p&gt;</description></item><item><title>DreamerV3 训练技巧：从踩坑到收敛的实战经验</title><link>https://www.worldsensetech.com/zh/articles/dreamerv3-training-tips/</link><pubDate>Tue, 11 Aug 2026 00:00:00 +0000</pubDate><guid>https://www.worldsensetech.com/zh/articles/dreamerv3-training-tips/</guid><description>&lt;p&gt;上一篇文章梳理了世界模型的四条表征路线。今天我们回到 DreamerV3 的实战主题，聊聊训练过程中的那些坑和技巧。本文基于 DreamerV3 commit &lt;code&gt;e3f02248&lt;/code&gt;、JAX + Haiku、MuJoCo + DM Control 的本地实验环境，不同版本的参数名和配置可能有差异。&lt;/p&gt;
&lt;p&gt;DreamerV3 是目前最开源、最成熟的世界模型实现之一。但如果你真的动手训练过，一定知道这个过程并不轻松——环境配置、超参数调优、训练不稳定、收敛慢……各种坑。&lt;/p&gt;
&lt;p&gt;这篇文章总结我在训练 DreamerV3 过程中遇到的常见问题和解决方案，希望能帮你少走弯路。&lt;/p&gt;
&lt;h2 id="环境配置的坑"&gt;环境配置的坑&lt;/h2&gt;
&lt;h3 id="1-mujoco-版本问题"&gt;1. MuJoCo 版本问题&lt;/h3&gt;
&lt;p&gt;DreamerV3 的官方实现基于 JAX + MuJoCo。但 MuJoCo 的版本选择很关键：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;MuJoCo 2.x vs 3.x。官方代码基于 MuJoCo 2.x，但 3.x 版本有性能改进。如果用 3.x，需要修改部分 API 调用。&lt;/li&gt;
&lt;li&gt;mujoco-py vs mujoco。mujoco-py 是旧的 Python 绑定，已经停止维护。建议直接用官方的 mujoco 包。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;建议：优先使用与你当前 DreamerV3 commit 匹配的 MuJoCo 版本，不要一开始就升级整个环境。&lt;/p&gt;
&lt;h3 id="2-jax-的-gpu-配置"&gt;2. JAX 的 GPU 配置&lt;/h3&gt;
&lt;p&gt;JAX 的 GPU 支持需要正确安装 CUDA 和 cuDNN。常见问题：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;CUDA 版本不匹配。JAX 对 CUDA 版本有严格要求，安装前查看官方文档。&lt;/li&gt;
&lt;li&gt;GPU 内存不足。JAX 默认会占用所有 GPU 内存。可以设置 &lt;code&gt;XLA_PYTHON_CLIENT_MEM_FRACTION=0.9&lt;/code&gt; 限制内存使用。如果遇到编译阶段内存峰值过高，也可以设置 &lt;code&gt;XLA_PYTHON_CLIENT_PREALLOCATE=false&lt;/code&gt; 关闭预分配。&lt;/li&gt;
&lt;li&gt;多 GPU 问题。JAX 的多 GPU 支持和 PyTorch 不同，需要特别配置。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;下图是 DreamerV3 在 RTX 5090D 上训练时的实际 GPU 占用情况，显存占用约 25.6GB（32GB 的 78%），GPU 利用率 91%：
![DreamerV3 训练时 GPU 占用情况](/images/nvidia smi.png) 图：RTX 5090D 上 DreamerV3 训练时的 GPU 显存占用（25.6GB / 32GB，利用率 91%）&lt;/p&gt;</description></item></channel></rss>